1 paper
Zikun Li, Yixuan Mei, Shiqi Pan +9
LLM serving systems increasingly disaggregate inference into finer-grained stages, with recent approaches separating attention from FFN or MoE execution during decode. This operato…