1 paper · 1 filter
Chung-En Johnny Yu, Brian Jalaian, Nathaniel D. Bastian
Combining multiple Vision-Language Models (VLMs) can enhance multimodal reasoning and robustness, but aggregating heterogeneous models' outputs amplifies uncertainty and increases…