2 papers
cs.DC2026
LatencyPrism: Online Non-intrusive Latency Sculpting for SLO-Guaranteed LLM Inference
Yin Du, Jiayi Ren, Xiayu Sun +4
LLM inference latency critically determines user experience and operational costs, directly impacting throughput under SLO constraints. Even brief latency spikes degrade service qu…
cs.LG2025
Kunlun Anomaly Troubleshooter: Enabling Kernel-Level Anomaly Detection and Causal Reasoning for Large Model Distributed Inference
Yuyang Liu, Jingjing Cai, Jiayi Ren +4
Anomaly troubleshooting for large model distributed inference (LMDI) remains a critical challenge. Resolving anomalies such as inference performance degradation or latency jitter i…