2 papers
cs.CV2026
Aligning Multi-Trajectory Supervision with Policy Optimization for VLA Driving
Tian Zhang, Zhuo Huang, Hongrui Ye +3
Vision-language-action (VLA) driving methods increasingly combine multi-trajectory imitation learning with group-relative policy optimization (GRPO), making trajectory selection cr…
cs.LG2026
AcceRL: A Distributed Asynchronous Reinforcement Learning and World Model Framework for Vision-Language-Action Models
Chengxuan Lu, Shukuan Wang, Yanjie Li +10
Reinforcement learning (RL) for large-scale Vision-Language-Action (VLA) models is severely bottlenecked by synchronization barriers and the high cost of environment data acquisiti…