NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (26)

cs.CL2024

Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study

Shusheng Xu, Wei Fu, Jiaxuan Gao +6

cs.CV2026

Sword: Style-Robust World Models as Simulators via Dynamic Latent Bootstrapping for VLA Policy Post-Training

Jiaxuan Gao, Yongjian Guo, Zhong Guan +5

cs.DC2024

SRL: Scaling Distributed Reinforcement Learning to Over Ten Thousand Cores

Zhiyu Mei, Wei Fu, Jiaxuan Gao +3

cs.RO2026

Building a Scalable, Reproducible, Evaluatable, and Closed-Loop Simulation Environment Foundation for Embodied Intelligence

Junwu Xiong, Yongjian Guo, Mingxi Luo +17

cs.RO2023

Asynchronous Multi-Agent Reinforcement Learning for Efficient Real-Time Multi-Robot Cooperative Exploration

Chao Yu, Xinyi Yang, Jiaxuan Gao +8

cs.AI2026

Verifiable Process Rewards for Agentic Reasoning

Huining Yuan, Zelai Xu, Huaijie Wang +6

cs.CL2025

Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RL

Jiaxuan Gao, Wei Fu, Minyang Xie +5

cs.AI2026

From Self-Evolving Synthetic Data to Verifiable-Reward RL: Post-Training Multi-turn Interactive Tool-Using Agents

Jiaxuan Gao, Jiaao Chen, Chuyi He +3

cs.CV2022

Learning Efficient Multi-Agent Cooperative Visual Exploration

Chao Yu, Xinyi Yang, Jiaxuan Gao +3

cs.LG2026

AREAL-DTA: Dynamic Tree Attention for Efficient Reinforcement Learning of Large Language Models

Jiarui Zhang, Yuchen Yang, Ran Yan +8

cs.AI2024

LLM-Powered Hierarchical Language Agent for Real-time Human-AI Coordination

Jijia Liu, Chao Yu, Jiaxuan Gao +4

cs.LG2025

Fine-tuning Diffusion Policies with Backpropagation Through Diffusion Timesteps

Ningyuan Yang, Jiaxuan Gao, Feng Gao +2

cs.AI2023

Learning Zero-Shot Cooperation with Humans, Assuming Humans Are Biased

Chao Yu, Jiaxuan Gao, Weilin Liu +5

cs.DC2026

Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents

Ran Yan, Wei Fu, Jiale Li +21

cs.CV2025

Industrial-Grade Sensor Simulation via Gaussian Splatting: A Modular Framework for Scalable Editing and Full-Stack Validation

Xianming Zeng, Sicong Du, Qifeng Chen +13

cs.AI2026

Embodied Operators and Benchmarking: Toward Reusable and Deployable Embodied Intelligence Systems

Junwu Xiong, Jiaxuan Gao, Wei Chai +10

cs.CL2026

QuestA: Expanding Reasoning Capacity in LLMs via Question Augmentation

Jiazheng Li, Hongzhou Lin, Hong Lu +5

cs.LG2025

Extending Test-Time Scaling: A 3D Perspective with Context, Batch, and Turn

Chao Yu, Qixin Tan, Jiaxuan Gao +7

cs.AI2025

ICPL: Few-shot In-context Preference Learning via LLMs

Chao Yu, Qixin Tan, Hong Lu +5

cs.LG2022

The Surprising Effectiveness of PPO in Cooperative, Multi-Agent Games

Chao Yu, Akash Velu, Eugene Vinitsky +4

cs.LG2026

AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning

Wei Fu, Jiaxuan Gao, Xujie Shen +10

cs.AI2026

MAGE: Meta-Reinforcement Learning for Language Agents toward Strategic Exploration and Exploitation

Lu Yang, Zelai Xu, Minyang Xie +4

cs.RO2024

LAGOON: Language-Guided Motion Control

Shusheng Xu, Huaijie Wang, Jiaxuan Gao +3

cs.LG2024

On Designing Effective RL Reward at Training Time for LLM Reasoning

Jiaxuan Gao, Shusheng Xu, Wenjie Ye +6

cs.DC2025

AReaL-Hex: Accommodating Asynchronous RL Training over Heterogeneous GPUs

Ran Yan, Youhe Jiang, Tianyuan Wu +7

cs.CL2025

How Far Are We from Optimal Reasoning Efficiency?

Jiaxuan Gao, Shu Yan, Qixin Tan +6