2 papers
cs.CV2025
Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation
Ziming Wei, Bingqian Lin, Yunshuang Nie +4
Data scarcity is a long-standing challenge in the Vision-Language Navigation (VLN) field, which extremely hinders the generalization of agents to unseen environments. Previous work…
cs.RO2024
PIVOT-R: Primitive-Driven Waypoint-Aware World Model for Robotic Manipulation
Kaidong Zhang, Pengzhen Ren, Bingqian Lin +4
Language-guided robotic manipulation is a challenging task that requires an embodied agent to follow abstract user instructions to accomplish various complex manipulation tasks. Pr…