1 paper · 1 filter
Yichen Feng, Zhangchen Xu, Fengqing Jiang +5
Vision language models (VLMs) are expected to perform effective multimodal reasoning and make logically coherent decisions, which is critical to tasks such as diagram understanding…