4 papers
Diffusion-Guided Uncertainty-Aware Delayed Policy Optimization
Junqi Tu, Zejiao Liu, Fangfei Li +1
Reinforcement learning in real world environments often suffers from severe performance degradation due to delayed feedback. Existing approaches typically mitigate performance degr…
FP4 Explore, BF16 Train: Diffusion Reinforcement Learning via Efficient Rollout Scaling
Yitong Li, Junsong Chen, Shuchen Xue +8
Reinforcement-Learning-based post-training has recently emerged as a promising paradigm for aligning text-to-image diffusion models with human preferences. In recent studies, incre…
HCPO: Hierarchical Conductor-Based Policy Optimization in Multi-Agent Reinforcement Learning
Zejiao Liu, Junqi Tu, Yitian Hong +4
In cooperative Multi-Agent Reinforcement Learning (MARL), efficient exploration is crucial for optimizing the performance of joint policy. However, existing methods often update jo…
Robust and Efficient Communication in Multi-Agent Reinforcement Learning
Zejiao Liu, Yi Li, Jiali Wang +6
Multi-agent reinforcement learning (MARL) has made significant strides in enabling coordinated behaviors among autonomous agents. However, most existing approaches assume that comm…