3 papers
cs.LG2026
Entropy Pacing Policy Optimization for Multi-Task Agentic Reinforcement Learning
Zetian Hu, Shunyu Liu, Junjie Zhang +4
Recent breakthroughs of Reinforcement Learning (RL) have highlighted its potential for complex agentic Large Language Model (LLM) tasks. However, existing efforts largely focus on…
cs.LG2026
STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning
Junjie Zhang, Guozheng Ma, Shunyu Liu +5
Recent advances in Reinforcement Learning (RL) have underscored its potential for incentivizing reasoning capabilities of Large Language Models (LLMs). However, existing step-level…
cs.LG2025
A Survey of Direct Preference Optimization
Shunyu Liu, Wenkai Fang, Zetian Hu +9
Large Language Models (LLMs) have demonstrated unprecedented generative capabilities, yet their alignment with human values remains critical for ensuring helpful and harmless deplo…