1 paper
Weifang Zhang, Yuzhou Nie, Bowen Pang +2
Mixed batching (MB)--interleaving prefill and decode in a single batch--has become the standard scheduling strategy for large language model (LLM) inference due to its efficiency i…