2 papers
cs.LG2024
Towards Robust Offline-to-Online Reinforcement Learning via Uncertainty and Smoothness
Xiaoyu Wen, Xudong Yu, Rui Yang +3
To obtain a near-optimal policy with fewer interactions in Reinforcement Learning (RL), a promising approach involves the combination of offline RL, which enhances sample efficienc…
cs.LG2024
Regularized Conditional Diffusion Model for Multi-Task Preference Alignment
Xudong Yu, Chenjia Bai, Haoran He +2
Sequential decision-making is desired to align with human intents and exhibit versatility across various tasks. Previous methods formulate it as a conditional generation process, u…