1 paper
Ruiqi Lai, Hongrui Liu, Chengzhi Lu +6
The architectural shift to prefill/decode (PD) disaggregation in LLM serving improves resource utilization but struggles with the bursty nature of modern workloads. Existing autosc…