1 paper · 1 filter
Mingyang Song, Haoyu Sun, Jiawei Gu +4
When humans face problems beyond their immediate capabilities, they rely on tools, providing a promising paradigm for improving visual reasoning in multimodal large language models…