1 paper
Guoqin Tang, Qingxuan Jia, Zeyuan Huang +3
Vision-language models (VLMs) have achieved remarkable success in scene understanding and perception tasks, enabling robots to plan and execute actions adaptively in dynamic enviro…