Showing cs.AIShow all
3 papers · 1 filter
cs.AI2026
Differentiable Evolutionary Reinforcement Learning
Sitao Cheng, Tianle Li, Xuhan Huang +2
Crafting effective reward signals remains a central challenge in Reinforcement Learning (RL), especially for complex reasoning tasks. Existing automated reward optimization methods…
cs.AI2026
Breaking Contextual Inertia: Reinforcement Learning with Single-Turn Anchors for Stable Multi-Turn Interaction
Xingwu Chen, Zhanqiu Zhang, Yiwen Guo +1
While LLMs demonstrate strong reasoning capabilities when provided with full information in a single turn, they exhibit substantial vulnerability in multi-turn interactions. Specif…
cs.AI2026
Structured Role-Aware Policy Optimization for Multimodal Reasoning
Bingqing Jiang, Difan Zou
Reinforcement learning from verifiable rewards (RLVR), especially with Group Relative Policy Optimization (GRPO), has shown strong potential for improving the reasoning capabilitie…