1 paper
Xinyue Ma, Heelim Hong, Taegeon Um +4
Serving long-context LLMs is challenging because request lengths and batch composition vary during token generation, causing the memory footprint to fluctuate significantly at runt…