1 paper
Ahmad Rashid, Ruotian Wu, Rongqi Fan +3
Reward-guided text generation (RGTG) has emerged as a viable alternative to offline reinforcement learning from human feedback (RLHF). RGTG methods can align baseline language mode…