3 papers
cs.CL2026
Regret Pre-training: Bridging Prior and Posterior Views for Enhanced Knowledge Grounding
Mingkuan Zhao, Xiayu Sun, Wentao Hu +5
Causal language models factorize sequence probabilities using only preceding context, leaving future information unexploited during training despite its availability in the trainin…
cs.CL2026
Resonant Context Anchoring: Decoupling Attention Routing and Signal Gain at Inference Time
Mingkuan Zhao, Yide Gao, Wentao Hu +6
Large Language Models (LLMs) frequently exhibit "contextual disregard" when faced with input evidence that conflicts with their internal parametric memory, leading to persistent fa…
cs.DC2026
LatencyPrism: Online Non-intrusive Latency Sculpting for SLO-Guaranteed LLM Inference
Yin Du, Jiayi Ren, Xiayu Sun +4
LLM inference latency critically determines user experience and operational costs, directly impacting throughput under SLO constraints. Even brief latency spikes degrade service qu…