2 papers
cs.DC2025
Host-Side Telemetry for Performance Diagnosis in Cloud and HPC GPU Infrastructure
Erfan Darzi, Aldo Pareja, Shreeanant Bharadwaj
Diagnosing GPU tail latency spikes in cloud and HPC infrastructure is critical for maintaining performance predictability and resource utilization, yet existing monitoring tools la…
cs.DC2025
Predictable LLM Serving on GPU Clusters
Erfan Darzi, Shreeanant Bharadwaj, Sree Bhargavi Balija
Latency-sensitive inference on shared A100 clusters often suffers noisy-neighbor interference on the PCIe fabric, inflating tail latency and SLO violations. We present a fabric-agn…