1 paper · 1 filter
Changming Xiao, Zhenliang Ni, Jinhui He +2
As vision-language models (VLMs) rapidly advance in image understanding, cross-modal reasoning, and complex instruction execution, instruction-following capability has become a key…