2 papers
cs.LG2026
EP-GRPO: Entropy-Progress Aligned Group Relative Policy Optimization with Implicit Process Guidance
Song Yu, Li Li, Wenwen Zhao +1
Reinforcement learning with verifiable rewards (RLVR), particularly Group Relative Policy Optimization (GRPO), has advanced LLM reasoning. However, GRPO suffers from three credit a…
cs.IR2025
Enhance Large Language Models as Recommendation Systems with Collaborative Filtering
Zhisheng Yang, Xiaofei Xu, Ke Deng +1
As powerful tools in Natural Language Processing (NLP), Large Language Models (LLMs) have been leveraged for crafting recommendations to achieve precise alignment with user prefere…