1 paper
Xiaoxiang Shi, Colin Cai, Junjia Du +1
Monolithic serving with chunked prefill improves GPU utilization by batching prefill and decode together, but suffers from fine-grained phase interference. Engine-level prefill-dec…