1 paper · 1 filter
Xiaoyu Zhu, Xinke Deng, Suresh Taddewadikar +4
Multimodal large language models increasingly use visual chain-of-thought (Visual CoT) to reason about spatial, temporal, and embodied environments. By generating intermediate reas…