2 papers
stat.ML2026
Pessimistic Risk-Aware Policy Learning in Contextual Bandits
Yilong Wan, Yuqiang Li, Xianyi Wu
We study risk-aware offline policy learning, aiming to learn a decision rule from logged data that is optimal under general risk criteria. This problem is crucial in high-stakes do…
cs.LG2026
Improved Model-based Reinforcement Learning with Smooth Kernels
Kun Long, Yuqiang Li, Xianyi Wu
For continuous state-action space scenarios, classical reinforcement learning (RL) theory predominantly focuses on low-rank Markov decision processes (MDPs), which provide sample-e…