1 paper
Matteo Gallici, Haitz Sáez de Ocáriz Borde
Fine-tuning pre-trained generative models with Reinforcement Learning (RL) has emerged as an effective approach for aligning outputs more closely with nuanced human preferences. In…