1 paper
Yunpeng Qing, Yixiao Chi, Shuo Chen +5
Recent advances in offline Reinforcement Learning (RL) have proven that effective policy learning can benefit from imposing conservative constraints on pre-collected datasets. Howe…