2 papers
cs.CL2026
Logic-Regularized Verifier Elicits Reasoning from LLMs
Xinyu Wang, Changzhi Sun, Lian Cheng +4
Verifiers are crucial components for enhancing modern LLMs' reasoning capability. Typicalverifiers require resource-intensive superviseddataset construction, which is costly and fa…
cs.LG2026
Stabilizing LLM Supervised Fine-Tuning via Explicit Distributional Control
Xinyu Wang, Changzhi Sun, Yuanbin Wu +1
Post-training large language models (LLMs) often suffers from catastrophic forgetting, where improvements on a target objective degrade previously acquired capabilities. Recent evi…