6 papers
Bridge-WA: Predicting Where and How the World Changes for Robotic Action
Yongjie Bai, Hanting Wang, Mingtong Dai +3
General-purpose vision-language-action models benefit from large vision-language priors, but effective manipulation also requires anticipating action-relevant scene changes. Existi…
SkiP: When to Skip and When to Refine for Efficient Robot Manipulation
Mingtong Dai, Guanqi Peng, Yongjie Bai +5
Previous imitation learning policies predict future actions at every control step, whether in smooth motion phases or precise, contact-rich operation phases. This uniform treatment…
Learning to See and Act: Task-Aware Virtual View Exploration for Robotic Manipulation
Yongjie Bai, Zhouxia Wang, Yang Liu +8
Recent vision-language-action (VLA) models for multi-task robot manipulation often rely on fixed camera setups and shared visual encoders, which limit their performance under occlu…
PhysLLM: Harnessing Large Language Models for Cross-Modal Remote Physiological Sensing
Yiping Xie, Bo Zhao, Mingtong Dai +6
Remote photoplethysmography (rPPG) enables non-contact physiological measurement but remains highly susceptible to illumination changes, motion artifacts, and limited temporal mode…
GraspView: Active Perception Scoring and Best-View Optimization for Robotic Grasping in Cluttered Environments
Shenglin Wang, Mingtong Dai, Jingxuan Su +4
Robotic grasping is a fundamental capability for autonomous manipulation, yet remains highly challenging in cluttered environments where occlusion, poor perception quality, and inc…
RoVer: Robot Reward Model as Test-Time Verifier for Vision-Language-Action Model
Mingtong Dai, Lingbo Liu, Yongjie Bai +6
Vision-Language-Action (VLA) models have become a prominent paradigm for embodied intelligence, yet further performance improvements typically rely on scaling up training data and…