1 paper
Yinuo Zhao, Jiale Yuan, Zhiyuan Xu +6
Recent advances in vision-language models (VLMs) have significantly improved performance in embodied tasks such as goal decomposition and visual comprehension. However, providing a…