1 paper
Mingkang Dong, Hongyi Cai, Xiwen Lei +3
Multimodal instruction tuning is the de facto recipe for adapting vision language models (VLMs), yet instruction data are highly redundant, making data selection critical for train…