4 papers
SceneTeract: Agentic Functional Affordances and VLM Grounding in 3D Scenes
Léopold Maillard, Francis Engelmann, Tom Durand +5
Embodied AI depends on interactive 3D environments that support meaningful activities for diverse users, yet assessing their functional affordances remains a core challenge. We int…
HoMeR: Learning In-the-Wild Mobile Manipulation via Hybrid Imitation and Whole-Body Control
Priya Sundaresan, Rhea Malhotra, Phillip Miao +7
We introduce HoMeR, an imitation learning framework for mobile manipulation that combines whole-body control with hybrid action modes that handle both long-range and fine-grained m…
Img2CAD: Reverse Engineering 3D CAD Models from Images through VLM-Assisted Conditional Factorization
Yang You, Mikaela Angelina Uy, Jiaqi Han +7
Reverse engineering 3D computer-aided design (CAD) models from images is an important task for many downstream applications including interactive editing, manufacturing, architectu…
SLAG: Scalable Language-Augmented Gaussian Splatting
Laszlo Szilagyi, Francis Engelmann, Jeannette Bohg
Language-augmented scene representations hold great promise for large-scale robotics applications such as search-and-rescue, smart cities, and mining. Many of these scenarios are t…