1 paper
Qingyao Tian, Bingyu Yang, Huai Liao +4
Vision-language models (VLMs) have recently shown remarkable performance in navigation and localization tasks by leveraging large-scale pretraining for semantic understanding. Howe…