3 papers
cs.RO2026
Hermite Curves as Trajectory Priors for Vision-Language-Action Models
Qi Lv, Jianming Xing, Zhao Yang +5
Despite recent progress in Vision-Language-Action (VLA) models for robotic manipulation, the action chunk remains a weakly structured interface. Existing work typically flatten eac…
cs.CV2026
Technical Report of RoboSpatial Challenge at CVPR 2026: Selective Reasoning Activation and Reference-Frame Disambiguation for Embodied Spatial Reasoning
Yuxiang Xie, Qi Lv, Jianming Xing +4
Vision-language models achieve strong general perception but often struggle with the spatial reasoning required for embodied tasks. We present RoboSpatialBrain, our submission to t…
cs.CV2026
Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction
Zijian Hong, Qi Lv, Yuxiang Xie +4
Visual pointing maps a language instruction to pixel co ordinates, a core skill for embodied AI. We describe our PointArena 2026 solution, which achieves 77.2% overall accuracy and…