1 paper
Xiaoyu Zhu, Xinke Deng, Suresh Taddewadikar +4
Multimodal large language models increasingly use visual chain-of-thought (Visual CoT) to reason about spatial, temporal, and embodied environments. By generating intermediate reas…