Showing cs.ROShow all
2 papers · 1 filter
cs.RO2026
VICX: Generalizable Robot Manipulation via Video Generation and In-Context Operator Network
Song Chen, Linyan Xiang, Ying Zhou +1
Generalizable robot manipulation requires not only task-level reasoning over unseen scenes, but also reliable grounding of visual plans into embodiment-specific execution. To bridg…
cs.RO2026
RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation
Dayu Xia, Yue Shi, Yao Mu +7
Vision-language models (VLMs) are increasingly explored as visual critics, reward generators, and failure detectors in robotic manipulation. These roles implicitly require models t…