1 paper · 1 filter
Abhijnan Nath, Alireza Bagheri Garakani, Tianchen Zhou +3
Large language models are increasingly trained via reinforcement learning for personalized recommendation tasks, but standard methods like GRPO rely on sparse, sequence-level rewar…