Showing stat.MLShow all
2 papers · 1 filter
stat.ML2026
Off-Policy Evaluation for Missingness-Aware Policies in MDPs with Rewards Missing Not at Random
Ziheng Wei, Annie Qu, Rui Miao
In offline Reinforcement Learning, immediate rewards in logged batch data are often unobserved due to sparse or irregular record-keeping, or censored beyond certain reward values.…
stat.ML2026
Reinforcement Learning for Individual Optimal Policy from Heterogeneous Data
Rui Miao, Babak Shahbaba, Annie Qu
Offline reinforcement learning (RL) aims to find optimal policies in dynamic environments in order to maximize the expected total rewards by leveraging pre-collected data. Learning…