1 paper
Min Wang, Ata Mahjoubfar
Agentic vision-language models increasingly act through extended interactions, but most evaluations still focus on single-image, single-turn correctness. We introduce AMIGO (Agenti…