1 paper
Kangyi Wu, Pengna Li, Kailin Lyu +5
Vision-Language Navigation(VLN) requires an agent to navigate through 3D environments by following natural language instructions. While recent Video Large Language Models(Video-LLM…