1 paper · 1 filter
Xuyang Chen, Keyu Yan, Wenhan Cao +1
Offline reinforcement learning (RL) learns policies from fixed datasets without online interactions, but suffers from distribution shift, causing inaccurate evaluation and overesti…