2 papers
cs.CV2026
PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
Wenqi Liang, Gan Sun, Yao He +5
Vision-Language-Action models (VLAs) are emerging as powerful tools for learning generalizable visuomotor control policies. However, current VLAs are mostly trained on large-scale…
cs.RO2025
Never-Ending Behavior-Cloning Agent for Robotic Manipulation
Wenqi Liang, Gan Sun, Yao He +3
Relying on multi-modal observations, embodied robots (e.g., humanoid robots) could perform multiple robotic manipulation tasks in unstructured real-world environments. However, mos…