1 paper
Chung-En Johnny Yu, David Garcia, Brian Jalaian +1
Aggregating heterogeneous vision-language models (VLMs) can improve multimodal reasoning, but neither an individual model's confidence nor that of the aggregated answer measures re…