Showing cs.LGShow all
3 papers · 1 filter
cs.LG2026
N-GRPO: Embedding-Level Neighbor Mixing for Enhanced Policy Optimization
Xukun Zhu, Hang Yu, Peng Di +1
The success of Large Language Models in mathematical reasoning relies heavily on the generation of diverse and valid solution paths during the rollout phase. However, current rollo…
cs.LG2026
Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward
Xuexiang Wen, Hang Yu, Linchao Zhu +1
While Reinforcement Learning with Verifiable Rewards (RLVR) has recently emerged as a promising post-training paradigm for Large Language Models (LLMs), its dependency on the gold…
cs.LG2026
ACSAC: Adaptive Chunk Size Actor-Critic with Causal Transformer Q-Network
Qian Chen, Junqiao Zhao, Hongtu Zhou +4
Long-horizon, sparse-reward tasks pose a fundamental challenge for reinforcement learning, since single-step TD learning suffers from bootstrapping error accumulation across succes…