1 paper
Peng Sun, Yi Yang, Huawen Shen +4
Visual instruction tuning is crucial for improving vision-language large models (VLLMs). However, many samples can be solved via linguistic patterns or common-sense shortcuts, with…