5 papers · 1 filter
Cross-Domain Energy-Guided Diffusion Generation for Off-Dynamics Reinforcement Learning
Yu Yang, Yihong Guo, Anqi Liu +1
Off-dynamics offline reinforcement learning seeks to learn a target-domain policy from a large source dataset and a limited target dataset under mismatched transition dynamics. Exi…
MOBODY: Model Based Off-Dynamics Offline Reinforcement Learning
Yihong Guo, Yu Yang, Pan Xu +1
We study off-dynamics offline reinforcement learning, where the goal is to learn a policy from offline source and limited target datasets with mismatched dynamics. Existing methods…
Group-Sensitive Offline Contextual Bandits
Yihong Guo, Junjie Luo, Guodong Gao +2
Offline contextual bandits allow one to learn policies from historical/offline data without requiring online interaction. However, offline policy optimization that maximizes overal…
Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation
Yihong Guo, Yixuan Wang, Yuanyuan Shi +2
Training a policy in a source domain for deployment in the target domain under a dynamics shift can be challenging, often resulting in performance degradation. Previous work tackle…
Distributionally Robust Policy Evaluation under General Covariate Shift in Contextual Bandits
Yihong Guo, Hao Liu, Yisong Yue +1
We introduce a distributionally robust approach that enhances the reliability of offline policy evaluation in contextual bandits under general covariate shifts. Our method aims to…