2 papers
cs.AI2026
Graph-Enhanced Policy Optimization in LLM Agent Training
Jiazhen Yuan, Zhike Gong, Jinquan Hang +2
Multi-step LLM agents in interactive environments represent a crucial step toward long-horizon decision-making. To train such agents, group-based reinforcement learning is widely a…
cs.AI2025
Demystifying Reasoning Dynamics with Mutual Information: Thinking Tokens are Information Peaks in LLM Reasoning
Chen Qian, Dongrui Liu, Haochen Wen +3
Large reasoning models (LRMs) have demonstrated impressive capabilities in complex problem-solving, yet their internal reasoning mechanisms remain poorly understood. In this paper,…