2 papers
cs.CL2026
TRiMS: Real-Time Tracking of Minimal Sufficient Length for Efficient Reasoning via RL
Tingcheng Bian, Jinchang Luo, Mingquan Cheng +5
Large language models achieve breakthroughs in complex reasoning via long chain-of-thought sequences. However, this often leads to severe reasoning inflation, causing substantial c…
cs.CL2026
GlobalRAG: Enhancing Global Reasoning in Multi-hop Question Answering via Reinforcement Learning
Jinchang Luo, Mingquan Cheng, Fan Wan +7
Reinforcement learning has recently shown promise in improving retrieval-augmented generation (RAG). Despite these advances, its effectiveness in multi-hop question answering (QA)…