8 papers
Efficient and Uncertainty-Aware Diffusion Framework for Offline-to-Online Reinforcement Learning
Ha Manh Bui, Metod Jazbec, Eric Nalisnick +1
Offline-to-Online Reinforcement Learning (O2O-RL) leverages an offline, pre-trained policy to minimize costly online interactions. Although data-efficient, O2O-RL is susceptible to…
Configurable Reward Model for Balanced Safety Alignment
Zhengping Jiang, Mehran Khodabandeh, Akash Bharadwaj +5
Aligning large language models (LLMs) to heterogeneous and rapidly evolving safety requirements remains a critical challenge. Existing instruction-tuned LLMs and standalone safety…
Cross-Domain Energy-Guided Diffusion Generation for Off-Dynamics Reinforcement Learning
Yu Yang, Yihong Guo, Anqi Liu +1
Off-dynamics offline reinforcement learning seeks to learn a target-domain policy from a large source dataset and a limited target dataset under mismatched transition dynamics. Exi…
MOBODY: Model Based Off-Dynamics Offline Reinforcement Learning
Yihong Guo, Yu Yang, Pan Xu +1
We study off-dynamics offline reinforcement learning, where the goal is to learn a policy from offline source and limited target datasets with mismatched dynamics. Existing methods…
CorrectionPlanner: Self-Correction Planner with Reinforcement Learning in Autonomous Driving
Yihong Guo, Dongqiangzi Ye, Sijia Chen +2
Autonomous driving requires safe planning, but most learning-based planners lack explicit self-correction ability: once an unsafe action is proposed, there is no mechanism to corre…
Group-Sensitive Offline Contextual Bandits
Yihong Guo, Junjie Luo, Guodong Gao +2
Offline contextual bandits allow one to learn policies from historical/offline data without requiring online interaction. However, offline policy optimization that maximizes overal…