2 papers
cs.LG2025
Mitigating Distribution Shift in Model-based Offline RL via Shifts-aware Reward Learning
Wang Luo, Haoran Li, Zicheng Zhang +4
Model-based offline reinforcement learning trains policies using pre-collected datasets and learned environment models, eliminating the need for direct real-world environment inter…
cs.LG2025
Dual Alignment Maximin Optimization for Offline Model-based RL
Chi Zhou, Wang Luo, Haoran Li +3
Offline reinforcement learning agents face significant deployment challenges due to the synthetic-to-real distribution mismatch. While most prior research has focused on improving…