1 paper · 1 filter
Meixuan Wang, Yinyu Ye, Zijie Zhou
We study offline scheduling for large language model (LLM) serving under a fixed KV-cache memory budget, where requests have heterogeneous prompt (prefill) and response (decode) le…