2 papers
cs.LG2026
Conditional Sequence Modeling for Safe Reinforcement Learning
Wensong Bai, Chao Zhang, Qihang Xu +3
Offline safe reinforcement learning (RL) aims to learn policies from a fixed dataset while maximizing performance under cumulative cost constraints. In practice, deployment require…
cs.LG2024
PACER: A Fully Push-forward-based Distributional Reinforcement Learning Algorithm
Wensong Bai, Chao Zhang, Yichao Fu +3
In this paper, we propose the first fully push-forward-based distributional reinforcement learning algorithm, named PACER, which consists of a distributional critic, a stochastic a…