1 paper · 1 filter
Ashutosh Adhikari, Mirella Lapata
Tool-augmented multimodal reasoning enables visual language models (VLMs) to improve perception by interacting with external tools (e.g., cropping, depth estimation). However, such…