1 paper
Yingru Li, Jiacai Liu, Jiawei Xu +4
Policy gradient methods for Large Language Models optimize a policy I¨I^¸ via a surrogate objective computed from samples of a rollout policy I¨roll. However, modern…