2 papers
cs.LG2024
CANDOR: Counterfactual ANnotated DOubly Robust Off-Policy Evaluation
Aishwarya Mandyam, Shengpu Tang, Jiayu Yao +2
Off-policy evaluation (OPE) is critical for applying contextual bandit algorithms to high-stakes decision-making settings such as healthcare, where new treatment policies must be e…
cs.LG2023
Counterfactual-Augmented Importance Sampling for Semi-Offline Policy Evaluation
Shengpu Tang, Jenna Wiens
In applying reinforcement learning (RL) to high-stakes domains, quantitative and qualitative evaluation using observational data can help practitioners understand the generalizatio…