1 paper
Xiyao Wang, Zhengyuan Yang, Linjie Li +6
Despite significant advancements in vision-language models (VLMs), there lacks effective approaches to enhance response quality by scaling inference-time computation. This capabili…