1 paper · 1 filter
Chenguang Huang, Oier Mees, Andy Zeng +1
Grounding language to a navigating agent's observations can leverage pretrained multimodal foundation models to match perceptions to object or event descriptions. However, previous…