1 paper · 1 filter
Chenglong Wang, Hang Zhou, Yimin Hu +5
Applying Reinforcement Learning (RL) to sequence generation models enables the direct optimization of long-term rewards (\textit{e.g.,} BLEU and human feedback), but typically requ…