3 papers
cs.RO2026
ManipArena: Comprehensive Real-world Evaluation of Reasoning-Oriented Generalist Robot Manipulation
Yu Sun, Meng Cao, Yang Ping +24
Vision-Language-Action (VLA) models and world-action models have emerged as central paradigms for general-purpose robotic intelligence, yet their empirical progress remains constra…
cs.RO2025
Action Tokenizer Matters in In-Context Imitation Learning
An Dinh Vuong, Minh Nhat Vu, Dong An +1
In-context imitation learning (ICIL) is a new paradigm that enables robots to generalize from demonstrations to unseen tasks without retraining. A well-structured action representa…
cs.RO2025
Improving Robotic Manipulation with Efficient Geometry-Aware Vision Encoder
An Dinh Vuong, Minh Nhat Vu, Ian Reid
Existing RGB-based imitation learning approaches typically employ traditional vision encoders such as ResNet or ViT, which lack explicit 3D reasoning capabilities. Recent geometry-…