7 papers
Balancing Performance and Diversity in GRPO Autoregressive Text-to-Image Post-Training
Yuanhao Chiang, Hongbo Duan, Chunru Yang +3
Autoregressive text-to-image (T2I) generation has recently advanced rapidly, yet aligning generated images with human preferences remains challenging. GRPO-style online reinforceme…
Libra-VLA: Achieving Learning Equilibrium via Asynchronous Coarse-to-Fine Dual-System
Yifei Wei, Linqing Zhong, Yi Liu +4
Vision-Language-Action (VLA) models are a promising paradigm for generalist robotic manipulation by grounding high-level semantic instructions into executable physical actions. How…
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
Linqing Zhong, Yi Liu, Yifei Wei +4
Vision-Language-Action models have emerged as essential generalist robot policies for diverse manipulation tasks, conventionally relying on directly translating multimodal inputs i…
GeoZero: Incentivizing Reasoning from Scratch on Geospatial Scenes
Di Wang, Shunyu Liu, Wentao Jiang +10
Multimodal large language models (MLLMs) have undergone rapid development in advancing geospatial scene understanding. Recent studies have sought to enhance the reasoning capabilit…
SOP: A Scalable Online Post-Training System for Vision-Language-Action Models
Mingjie Pan, Siyuan Feng, Qinglin Zhang +9
Vision-language-action (VLA) models achieve strong generalization through large-scale pre-training, but real-world deployment requires expert-level task proficiency in addition to…
CausalNav: A Long-term Embodied Navigation System for Autonomous Mobile Robots in Dynamic Outdoor Scenarios
Hongbo Duan, Shangyi Luo, Zhiyuan Deng +5
Autonomous language-guided navigation in large-scale outdoor environments remains a key challenge in mobile robotics, due to difficulties in semantic reasoning, dynamic conditions,…