1 citations · 1 across the 6 of their papers we have counts for
1 paper · 1 filter
Xuanfei Ren, Tengyang Xie
Offline reinforcement learning is typically analyzed under process-level reward supervision, yet many sequential decision datasets record only trajectory-level outcomes. We develop…