Showing cs.ROShow all
2 papers · 1 filter
cs.RO2026
What Matters in Building Vision-Language-Action Models for Generalist Robots
Xinghang Li, Peiyan Li, Long Qian +10
To utilize Foundation Vision Language Models (VLMs) for robotic tasks and motion planning, the community has proposed different methods for injecting action components into VLMs an…
cs.RO2024
One-shot Video Imitation via Parameterized Symbolic Abstraction Graphs
Jianren Wang, Kangni Liu, Dingkun Guo +2
Learning to manipulate dynamic and deformable objects from a single demonstration video holds great promise in terms of scalability. Previous approaches have predominantly focused…