Showing cs.AIShow all
2 papers · 1 filter
cs.AI2026
EviBack: Search-Agent Reinforcement Learning via Evidence-Constrained Teacher Backoff
Xiao Ma, Zhiquan Hu, Yi Wei +6
Reinforcement learning enables Agentic RAG systems to learn multi-turn search from verifiable outcome rewards, but all- zero rollout groups provide no comparative signal and may hi…
cs.AI2026
Tandem: Riding Together with Large and Small Language Models for Efficient Reasoning
Zichuan Fu, Xian Wu, Guojing Li +7
Recent advancements in large language models (LLMs) have catalyzed the rise of reasoning-intensive inference paradigms, where models perform explicit step-by-step reasoning before…