3 papers
cs.LG2026
ExpThink: Experience-Guided Reinforcement Learning for Adaptive Chain-of-Thought Compression
Tingcheng Bian, Yuzhe Zhang, Jing Jin +5
Large reasoning models (LRMs) achieve strong performance via extended chain-of-thought (CoT) reasoning, yet suffer from excessive token consumption and high inference latency. Exis…
cs.CL2026
TRiMS: Real-Time Tracking of Minimal Sufficient Length for Efficient Reasoning via RL
Tingcheng Bian, Jinchang Luo, Mingquan Cheng +5
Large language models achieve breakthroughs in complex reasoning via long chain-of-thought sequences. However, this often leads to severe reasoning inflation, causing substantial c…
cs.CL2026
GlobalRAG: Enhancing Global Reasoning in Multi-hop Question Answering via Reinforcement Learning
Jinchang Luo, Mingquan Cheng, Fan Wan +7
Reinforcement learning has recently shown promise in improving retrieval-augmented generation (RAG). Despite these advances, its effectiveness in multi-hop question answering (QA)…