1 paper · 1 filter
Yan Shi, Xiaochao Wang, Jingchun Gao +7
Chunked prefill pipeline parallelism (CPP) is a key technique for LLM inference. However, equal-size chunks exhibit imbalanced latency, as later chunks attend longer prefix KV cach…