1 paper · 1 filter
Takuya Koriyama, Tengyuan Liang
We propose Markov Chain from Human Feedback (MCHF), an elementary approach for aligning generative models from pairwise human preferences. Unlike Reinforcement Learning from Human…