1 paper
Yuanfu Sun, Kang Li, Pengkang Guo +2
Recent advances in large language models (LLMs) have opened new avenues for multimodal reasoning. Yet, most existing methods still rely on pretrained vision-language models (VLMs)…