2 papers
cs.LG2025
AlignIQL: Policy Alignment in Implicit Q-Learning through Constrained Optimization
Longxiang He, Li Shen, Xueqian Wang
Implicit Q-learning (IQL) serves as a strong baseline for offline RL, which learns the value function using only dataset actions through quantile regression. However, it is unclear…
cs.LG2025
Robust Policy Expansion for Offline-to-Online RL under Diverse Data Corruption
Longxiang He, Deheng Ye, Junbo Tan +2
Pretraining a policy on offline data followed by fine-tuning through online interactions, known as Offline-to-Online Reinforcement Learning (O2O RL), has emerged as a promising par…