1 paper
Jonathan Colaço Carr, Prakash Panangaden, Doina Precup
Learning from Preferential Feedback (LfPF) plays an essential role in training Large Language Models, as well as certain types of interactive learning agents. However, a substantia…