Showing cs.AIShow all
2 papers · 1 filter
cs.AI2026
Robust Regularized Policy Iteration under Transition Uncertainty
Hongqiang Lin, Zhenghui Fu, Weihao Tang +4
Offline reinforcement learning (RL) enables data-efficient and safe policy learning without online exploration, but its performance often degrades under distribution shift. The lea…
cs.AI2026
Offline Policy Optimization with Posterior Sampling
Hongqiang Lin, Dongxu Zhang, Yiding Sun +3
A fundamental challenge in model-based offline reinforcement learning (RL) lies in the trade-off between generalization and robustness against exploitation errors in out-of-distrib…