1 paper
Shiming Xie, Hong Chen, Fred Yu +3
Learning from human preference is a paradigm used in large-scale language model (LLM) fine-tuning step to better align pretrained LLM to human preference for downstream task. In th…