1 paper
Evan Assmus, Qining Zhang, Lei Ying
Preference-based reinforcement learning (PbRL) for general stochastic MDPs often requires training a reward model. Existing reward-model-free methods are either restricted to bandi…