2 papers
cs.LG2026
VIPO: Value Function Inconsistency Penalized Offline Reinforcement Learning
Xuyang Chen, Keyu Yan, Guojian Wang +1
Offline reinforcement learning (RL) learns effective policies from pre-collected datasets, offering a practical solution for applications where online interactions are risky or cos…
cs.LG2025
Target-Aligned Fusion for Decision-Sequence Learning under Dynamics Shift
Guojian Wang, Quinson Hon, Xuyang Chen +1
External trajectories can improve offline decision-sequence learning, but dynamics shift may make some source subsequences inconsistent with the target environment. We study how to…