1 paper · 1 filter
Andreas Schlaginhaufen, Reda Ouhamma, Maryam Kamgarpour
We study reinforcement learning from human feedback in general Markov decision processes, where agents learn from trajectory-level preference comparisons. A central challenge in th…