8 papers
Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies
Zhuoran Li, Hai Zhong, Xun Wang +3
Online Multi-Agent Reinforcement Learning (MARL) is a prominent framework for efficient agent coordination. Crucially, enhancing policy expressiveness is pivotal for achieving supe…
Offline Diffusion Policy for Multi-User Delay-Constrained Scheduling
Zhuoran Li, Ruishuo Chen, Hai Zhong +1
Effective multi-user delay-constrained scheduling is crucial in various real-world applications, including embodied AI, instant messaging, live streaming, and data center managemen…
Offline-to-Online Multi-Agent Reinforcement Learning with Offline Value Function Memory and Sequential Exploration
Hai Zhong, Xun Wang, Zhuoran Li +1
Offline-to-Online Reinforcement Learning has emerged as a powerful paradigm, leveraging offline data for initialization and online fine-tuning to enhance both sample efficiency and…
OM2P: Offline Multi-Agent Mean-Flow Policy
Zhuoran Li, Xun Wang, Hai Zhong +3
Generative models, especially diffusion and flow-based models, have been promising in offline multi-agent reinforcement learning. However, integrating powerful generative models in…
Reparameterization Proximal Policy Optimization
Hai Zhong, Xun Wang, Zhuoran Li +1
By leveraging differentiable dynamics, Reparameterization Policy Gradient (RPG) achieves high sample efficiency. However, current approaches are hindered by two critical limitation…
Reparameterization Flow Policy Optimization
Hai Zhong, Zhuoran Li, Xun Wang +1
Reparameterization Policy Gradient (RPG) has emerged as a powerful paradigm for model-based reinforcement learning, enabling high sample efficiency by backpropagating gradients thr…