Showing cs.AIShow all
2 papers · 1 filter
cs.AI2026
Offline Policy Optimization with Posterior Sampling
Hongqiang Lin, Dongxu Zhang, Yiding Sun +3
A fundamental challenge in model-based offline reinforcement learning (RL) lies in the trade-off between generalization and robustness against exploitation errors in out-of-distrib…
cs.AI2026
Robust Regularized Policy Iteration under Transition Uncertainty
Hongqiang Lin, Zhenghui Fu, Weihao Tang +4
Offline reinforcement learning (RL) enables data-efficient and safe policy learning without online exploration, but its performance often degrades under distribution shift. The lea…