1 paper
Chenguang Huang, Oier Mees, Andy Zeng +1
Grounding language to a navigating agent's observations can leverage pretrained multimodal foundation models to match perceptions to object or event descriptions. However, previous…