2 papers
cs.LG2026
Filter, Then Reweight: Rethinking Optimization Granularity in On-Policy Distillation
Yuying Li, Leqi Zheng, Yongzi Yu +6
On-Policy distillation (OPD) in large language models is shifting from full-trace KL supervision toward more selective training paradigms. Recent OPD methods increasingly focus on…
cs.LG2026
Sample Transform Cost-Based Training-Free Hallucination Detector for Large Language Models
Zeyang Ding, Xinglin Hu, Jicong Fan
Hallucinations in large language models (LLMs) remain a central obstacle to trustworthy deployment, motivating detectors that are accurate, lightweight, and broadly applicable. Sin…