1 paper · 1 filter
Weifang Zhang, Yuzhou Nie, Bowen Pang +2
Mixed batching (MB)--interleaving prefill and decode in a single batch--has become the standard scheduling strategy for large language model (LLM) inference due to its efficiency i…