works on

From the 1 of 15 linked papers with an AI index.

collaborators

15 papers

cs.CV2026

PROBE: Manipulation-Grounded Visual Question Answering with VLM Agents

Vineet Bhat, Siyi Chen, Alex Zook +4

Vision-language Models (VLMs) excel at 2D grounding, spatial reasoning and agentic tool-based planning in static scenes. However, consider asking a home robot "Is my medication sti…

cs.RO2026

Scale Up Strategically: Learning Compositional Generalization via Bias-Aware Evaluation and Data Collection for Robotic Manipulation

Yu Qi, Zhang Ye, Xinyi Xu +6

Compositional generalization is essential for robot to follow diverse instructions. However, pretrained policies are known to take shortcuts, deferring to salient cues rather than…

cs.RO2026

Tactile Modality Fusion for Vision-Language-Action Models

Charlotte Morissette, Amin Abyaneh, Wei-Di Chang +5

The paper introduces TacFiLM, a lightweight method that fuses tactile data with visual features in vision‑language‑action models to improve robot manipulation tasks that involve co…

cs.RO2026

Vesta: A Generalist Embodied Reasoning Model

Johan Bjorck, Zhiqi Li, Yunze Man +29

Robots operating in open-world environments must seamlessly integrate localization, spatial reasoning, navigation, and long-horizon planning. While specialist models excel at indiv…

cs.MA2026

See What I See, Know What I Think: Dense Latent Communication Across Heterogeneous Agents

Siyi Chen, Xiaoyan Zhang, Meng Wu +7

Multi-agent systems communicate mostly through text, paying a lossy and expensive decode and re-encode cost. KV-cache communication is a promising alternative, yet most prior work…

cs.RO2026

VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation

Siyi Chen, Hugo Hadfield, Alex Zook +9

Open-vocabulary long-horizon manipulation requires robots to reason over flexible instructions and complex multi-object scenes while adaptively planning, executing, monitoring, and…