1 paper
Changti Wu, Jiahuai Mao, Yuzhuo Miao +6
Large-scale Visual Instruction Tuning (VIT) has become a key paradigm for advancing the performance of vision-language models (VLMs) across various multimodal tasks. However, train…