1 paper
Zhuo Zhi, Chen Feng, Adam Daneshmend +6
Multimodal large language models (MLLMs) show promise in tasks like visual question answering (VQA) but still face challenges in multimodal reasoning. Recent works adapt agentic fr…