2 papers
cs.CL2026
AutoVerifier: Residual-Guided Non-Parametric Optimization for Reference-Based Answer Verification
Zebei Zhao, Zhihao Shi, Minqi Shi
Reference-based verifiers are important for evaluating reasoning models and providing accurate outcome rewards in reinforcement learning with verifiable rewards. To improve verific…
cs.AI2026
Argus: A General-Purpose Agentic Reasoning Runtime for Long-Horizon Tasks
Boxiu Li, Zimo Wen, Yijia Fan +24
Long-horizon reasoning requires an agentic runtime that can persist when evidence supports its current approach and pivot when measurements reveal failure, hidden constraints, or a…