Publications (169)
MASP: Scalable GNN-based Planning for Multi-Agent Navigation
Xinyi Yang, Xinting Yang, Chao Yu +4
Active Neural Topological Mapping for Multi-Agent Exploration
Xinyi Yang, Yuxiang Yang, Chao Yu +5
Online Planning for Multi-UAV Pursuit-Evasion in Unknown Environments Using Deep Reinforcement Learning
Jiayu Chen, Chao Yu, Guosheng Li +6
Discovering Diverse Multi-Agent Strategic Behavior via Reward Randomization
Zhenggang Tang, Chao Yu, Boyuan Chen +6
Adapting Like Humans: A Metacognitive Agent with Test-time Reasoning
Yang Li, Zhiyuan He, Yuxuan Huang +5
SmartGR: Hierarchy and Beam-Aware Knowledge Distillation for Generative Recommendation
Ziheng Zhang, Yu Cui, Bohao Wang +6
Diverse Policies Recovering via Pointwise Mutual Information Weighted Imitation Learning
Hanlin Yang, Jian Yao, Weiming Liu +13
Single-photon computational 3D imaging at 45 km
Zheng-Ping Li, Xin Huang, Yuan Cao +9
Doppler-Based Multistatic Drone Tracking via Cellular Downlink Signals
Chenqing Ji, Qionghui Liu, Jiahong Liu +4
H$^2$R: Hierarchical Hindsight Reflection for Multi-Task LLM Agents
Shicheng Ye, Chao Yu, Kaiqiang Ke +2
ICPL: Few-shot In-context Preference Learning via LLMs
Chao Yu, Qixin Tan, Hong Lu +5
Solid-like high harmonic generation from rotationally periodic systems
Yigeng Peng, Tong Wu, Guanglu Yuan +3
A Survey on Self-play Methods in Reinforcement Learning
Ruize Zhang, Zelai Xu, Chengdong Ma +8
CASTER: A Computer-Vision-Assisted Wireless Channel Simulator for Gesture Recognition
Zhenyu Ren, Guoliang Li, Chenqing Ji +3
Multi-Agent Reinforcement Learning with a Hierarchy of Reward Machines
Xuejing Zheng, Chao Yu
Joint Learning of Experiential Rules and Policies for Large Language Model Agents
Shicheng Ye, Chao Yu
VISTA: Vision-Grounded and Physics-Validated Adaptation of UMI data for VLA Training
Siyuan Yang, Linzheng Guo, Ouyang Lu +10
Symmetrical Gaussian Error Linear Units (SGELUs)
Chao Yu, Zhiguo Su
MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs
Huining Yuan, Zelai Xu, Zheyue Tan +10
Human-Robot Cooperative Distribution Coupling for Hamiltonian-Constrained Social Navigation
Weizheng Wang, Chao Yu, Yu Wang +1
Accelerate Multi-Agent Reinforcement Learning in Zero-Sum Games with Subgame Curriculum Learning
Jiayu Chen, Zelai Xu, Yunfei Li +6
Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization
Zongkai Liu, Qian Lin, Chao Yu +4
DeltaFS: Pursuing Zero Update Overhead via Metadata-Enabled Delta Compression for Log-structured File System on Mobile Devices
Chao Wu, Cheng Ji, Geng Yuan +5
How to obtain complex transition dipole moments satisfying crystal symmetry and periodicity from ab-initio calculations
Shicheng Jiang, Chao Yu, Jigen Chen +3
Learning Strategic Language Agents in the Werewolf Game with Iterative Latent Space Policy Optimization
Zelai Xu, Wanjun Gu, Chao Yu +2
Fingerprint Recognition of Partial Discharge Signals in Deep Learning Enhanced Rydberg Atomic Sensors
Yi-Ming Yin, Qi-Feng Wang, Yu Ma +16
Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models
Liangzhi Shi, Shuaihang Chen, Feng Gao +8
Observation of non-Hermitian topology in cold Rydberg quantum gases
Jun Zhang, Ya-Jun Wang, Shi-Yao Shao +16
FlightBench: Benchmarking Learning-based Methods for Ego-vision-based Quadrotors Navigation
Shu-Ang Yu, Chao Yu, Feng Gao +2
Toward Real-World Cooperative and Competitive Soccer with Quadrupedal Robot Teams
Zhi Su, Yuman Gao, Emily Lukas +8
Reward-Robust RLHF in LLMs
Yuzi Yan, Xingzhou Lou, Jialian Li +6
Quantum-trajectory analysis for charge transfer in solid materials induced by strong laser fields
Shicheng Jiang, Chao Yu, Guanglu Yuan +3
Asynchronous Multi-Agent Reinforcement Learning for Efficient Real-Time Multi-Robot Cooperative Exploration
Chao Yu, Xinyi Yang, Jiaxuan Gao +8
Learning Efficient Multi-Agent Cooperative Visual Exploration
Chao Yu, Xinyi Yang, Jiaxuan Gao +3
LLM-Powered Hierarchical Language Agent for Real-time Human-AI Coordination
Jijia Liu, Chao Yu, Jiaxuan Gao +4
JuggleRL: Mastering Ball Juggling with a Quadrotor via Deep Reinforcement Learning
Shilong Ji, Yinuo Chen, Chuqi Wang +9
D3P: Dynamic Denoising Diffusion Policy via Reinforcement Learning
Shu-Ang Yu, Feng Gao, Yi Wu +2
Hierarchical Multi-agent Meta-Reinforcement Learning for Cross-channel Bidding
Shenghong He, Chao Yu
An Experimental Study of Passive UAV Tracking with Digital Arrays and Cellular Downlink Signals
Yifei Sun, Chao Yu, Yan Luo +4
LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies
Jialei Chen, Kai Wang, Kang Chen +9
HALO:Closing Sim-to-Real Gap for Heavy-loaded Humanoid Agile Motion Skills via Differentiable Simulation
Xingyi Wang, Chenyun Zhang, Weiji Xie +4
Plan To Predict: Learning an Uncertainty-Foreseeing Model for Model-Based Reinforcement Learning
Zifan Wu, Chao Yu, Chen Chen +2
WideSeek-R1: Exploring Width Scaling for Broad Information Seeking via Multi-Agent Reinforcement Learning
Zelai Xu, Zhexuan Xu, Ruize Zhang +7
Automatic Reward Shaping from Multi-Objective Human Heuristics
Yuqing Xie, Jiayu Chen, Wenhao Tang +3
GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models
5 Team, Aohan Zeng, Xin Lv +167
Compact free-running InGaAs/InP single-photon detector with 40% detection efficiency and 2.3 kcps dark count rate
Qi Xu, Chao Yu, Wei Chen +4
The Role of Shift Vector in High-Harmonic Generation from Non-Centrosymmetric Topological Insulators under Strong Laser Fields
Chen Qian, Chao Yu, Shicheng Jiang +6
Reinforcement Learning in Healthcare: A Survey
Chao Yu, Jiming Liu, Shamim Nemati
FUSCO: High-Performance Distributed Data Shuffling via Transformation-Communication Fusion
Zhuoran Zhu, Chunyang Zhu, Hao Lin +9
Constrained Sequence-to-Tree Generation for Hierarchical Text Classification
Chao Yu, Yi Shen, Yue Mao +1
RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models
Hongzhi Zang, Mingjie Wei, Si Xu +15
RLinf-USER: A Unified and Extensible System for Real-World Online Policy Learning in Embodied AI
Hongzhi Zang, Shu'ang Yu, Hao Lin +14
Enabling Large-Reach TLBs for High-Throughput Processors by Exploiting Memory Subregion Contiguity
Chao Yu, Yuebin Bai, Rui Wang
Reinforcement Learning with Knowledge Representation and Reasoning: A Brief Survey
Chao Yu, Shicheng Ye, Hankz Hankui Zhuo
Translate Policy to Language: Flow Matching Generated Rewards for LLM Explanations
Xinyi Yang, Liang Zeng, Heng Dong +6
Policy-regularized Offline Multi-objective Reinforcement Learning
Qian Lin, Chao Yu, Zongkai Liu +1
Off-Policy Primal-Dual Safe Reinforcement Learning
Zifan Wu, Bo Tang, Qian Lin +5
Population Redistribution among Multiple Electronic States of Molecular Nitrogen Ions in Strong Laser Fields
Jinping Yao, Shicheng Jiang, Wei Chu +11
Differential absorption ozone Lidar with 4H-SiC single-photon detectors
Xian-Song Zhao, Chao Yu, Chong Wang +7
ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning
Tonghe Zhang, Chao Yu, Sichang Su +1
SleepNetZero: Zero-Burden Zero-Shot Reliable Sleep Staging With Neural Networks Based on Ballistocardiograms
Shuzhen Li, Yuxin Chen, Xuesong Chen +9
An Offline Adaptation Framework for Constrained Multi-Objective Reinforcement Learning
Qian Lin, Zongkai Liu, Danying Mo +1
An Experimental Study on Fine-Grained Bistatic Sensing of UAV Trajectory via Cellular Downlink Signals
Chenqing Ji, Jiahong Liu, Qionghui Liu +3
Observation of Discrete Time Quasicrystal in Rydberg Atomic Gases
Dong-Yang Zhu, Zheng-Yuan Zhang, Qi-Feng Wang +17
WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL
Zhennan Jiang, Shangqing Zhou, Yutong Jiang +11
DS-SLAM: A Semantic Visual SLAM towards Dynamic Environments
Chao Yu, Zuxin Liu, Xinjun Liu +4
Compact and lightweight 1.5 μm lidar with a multi-mode fiber coupling free-running InGaAs/InP single-photon detector
Chao Yu, Jiawei Qiu, Haiyun Xia +3
Neural Internal Model Control: Learning a Robust Control Policy via Predictive Error Feedback
Feng Gao, Chao Yu, Yu Wang +1
UMI-Bench 1.0: An Open and Reproducible Real-World Benchmark for Tabletop Robotic Manipulation with UMI Data
Shi Jin, Yuntian Wang, Yuhui Duan +16
EvoMAS: Learning Execution-Time Workflows for Multi-Agent Systems
Chengdong Xu, Kaiqiang Ke, Ziheng Liu +4
WiSLAT: A Simultaneous Device Localization and Target Tracking Method for Wi-Fi Systems
Chunxi Chen, Jingwen Zhang, Chao Yu +2
Language Agents with Reinforcement Learning for Strategic Play in the Werewolf Game
Zelai Xu, Chao Yu, Fei Fang +2
Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network
Jijia Liu, Feng Gao, Qingmin Liao +2
Note on surface growth approach for bulk reconstruction
Chao Yu, Fang Zhong Chen, Yi-Yu Lin +2
Mastering Multi-Drone Volleyball through Hierarchical Co-Self-Play Reinforcement Learning
Ruize Zhang, Sirui Xiang, Zelai Xu +6
Revisiting Discrete Soft Actor-Critic
Haibin Zhou, Tong Wei, Zichuan Lin +6
CPGD: Toward Stable Rule-based Reinforcement Learning for Language Models
Zongkai Liu, Fanqing Meng, Lingxiao Du +4
Spec-VLA: Speculative Decoding for Vision-Language-Action Models with Relaxed Acceptance
Songsheng Wang, Rucheng Yu, Zhihang Yuan +4
Super-resolution single-photon imaging at 8.2 kilometers
Zheng-Ping Li, Xin Huang, Peng-Yu Jiang +6
EARL: Efficient Agentic Reinforcement Learning Systems for Large Language Models
Zheyue Tan, Mustapha Abdullahi, Tuo Shi +5
Ultraviolet photon-counting single-pixel imaging
Jun-Tian Ye, Chao Yu, Wenwen Li +6
Single-photon imaging over 200 km
Zheng-Ping Li, Jun-Tian Ye, Xin Huang +9
Deep Learning-based Modulation Detection for NOMA Systems
Wenwu Xie, Jian Xiao, Jinxia Yang +3
Revisiting Some Common Practices in Cooperative Multi-Agent Reinforcement Learning
Wei Fu, Chao Yu, Zelai Xu +2
Extending Test-Time Scaling: A 3D Perspective with Context, Batch, and Turn
Chao Yu, Qixin Tan, Jiaxuan Gao +7
Compact and fully functional high-frequency sine wave gating InGaAs/InP single-photon detector module
Qi Xu, Chao Yu, Dajian Cui +7
IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation
Zixuan Li, Haokun Lin, Yicheng Xiao +10
STEAM: Self-Supervised Temporal Ensemble Advantage Modeling for Real-World Robot Learning
Zhihao Liu, Qiuyi Gu, Yitao Wang +16
Multi-Agent Vulnerability Discovery for Autonomous Driving with Hazard Arbitration Reward
Weilin Liu, Ye Mu, Chao Yu +6
A Joint Training Dual-MRC Framework for Aspect Based Sentiment Analysis
Yue Mao, Yi Shen, Chao Yu +1
ESCM$^2$: Entire Space Counterfactual Multi-Task Model for Post-Click Conversion Rate Estimation
Hao Wang, Tai-Wei Chang, Tianqiao Liu +5
Recent advances in InGaAs/InP single-photon detectors
Chao Yu, Qi Xu, Jun Zhang
Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study
Shusheng Xu, Wei Fu, Jiaxuan Gao +6
Passive Motion Detection via mmWave Communication System
Jie Li, Chao Yu, Yan Luo +2
Red Teaming Large Reasoning Models
Jiawei Chen, Yang Yang, Chao Yu +6
Verifiable Process Rewards for Agentic Reasoning
Huining Yuan, Zelai Xu, Huaijie Wang +6
What Can RL Bring to VLA Generalization? An Empirical Study
Jijia Liu, Feng Gao, Bingwen Wei +5
Context-Picker: Dynamic context selection using multi-stage reinforcement learning
Siyuan Zhu, Chengdong Xu, Kaiqiang Ke +1
Coordinated Proximal Policy Optimization
Zifan Wu, Chao Yu, Deheng Ye +3
Electron-Backscattering-Assisted High Harmonic Generation from Bilayer Nanostructures
Chao Yu, Shicheng Jiang, Tong Wu +4