Showing cs.LGShow all
3 papers · 1 filter
cs.LG2025
Robust Policy Expansion for Offline-to-Online RL under Diverse Data Corruption
Longxiang He, Deheng Ye, Junbo Tan +2
Pretraining a policy on offline data followed by fine-tuning through online interactions, known as Offline-to-Online Reinforcement Learning (O2O RL), has emerged as a promising par…
cs.LG2024
AlignIQL: Policy Alignment in Implicit Q-Learning through Constrained Optimization
Longxiang He, Li Shen, Xueqian Wang
Implicit Q-learning (IQL) serves as a strong baseline for offline RL, which learns the value function using only dataset actions through quantile regression. However, it is unclear…
cs.LG2023
DiffCPS: Diffusion Model based Constrained Policy Search for Offline Reinforcement Learning
Longxiang He, Li Shen, Linrui Zhang +2
Constrained policy search (CPS) is a fundamental problem in offline reinforcement learning, which is generally solved by advantage weighted regression (AWR). However, previous meth…