3 papers
cs.LG2026
Cross-Domain Offline Policy Adaptation via Selective Transition Correction
Mengbei Yan, Jiafei Lyu, Shengjie Sun +5
It remains a critical challenge to adapt policies across domains with mismatched dynamics in reinforcement learning (RL). In this paper, we study cross-domain offline RL, where an…
cs.LG2025
PROF: An LLM-based Reward Code Preference Optimization Framework for Offline Imitation Learning
Shengjie Sun, Jiafei Lyu, Runze Liu +4
Offline imitation learning (offline IL) enables training effective policies without requiring explicit reward annotations. Recent approaches attempt to estimate rewards for unlabel…
cs.LG2024
ODRL: A Benchmark for Off-Dynamics Reinforcement Learning
Jiafei Lyu, Kang Xu, Jiacheng Xu +6
We consider off-dynamics reinforcement learning (RL) where one needs to transfer policies across different domains with dynamics mismatch. Despite the focus on developing dynamics-…