1 paper · 1 filter
Luofeng Liao, Zuyue Fu, Zhuoran Yang +3
In offline reinforcement learning (RL) an optimal policy is learned solely from a priori collected observational data. However, in observational data, actions are often confounded…