1 paper
Dayi Yao, Zijie Zhou
This paper studies a resource-allocation inefficiency in batched large language model (LLM) serving: heterogeneous requests that share a decode batch impose max-driven computationa…