1 paper · 1 filter
Satyam Kumar, Arpit Singh Gautam, Kailash Talreja +1
Efficient LLM serving must balance throughput and latency across diverse, bursty workloads. We introduce StreamServe, a disaggregated prefill decode serving architecture that combi…