125 citations · 252 across the 9 of their papers we have counts for
1 paper · 1 filter
Xin Xiao, Bohong Wu, Jiacong Wang +3
Existing image-text modality alignment in Vision Language Models (VLMs) treats each text token equally in an autoregressive manner. Despite being simple and effective, this method…