1 paper
Hengyuan Xu, Wei Cheng, Yumeng Ji +4
Explicit visual intermediates can help multimodal large language models (MLLMs) externalize spatial evidence and updated visual states, but their utility depends on whether an imag…