1 paper · 1 filter
Ruihan Lin, Zezhen Ding, Zean Han +1
Large Language Models (LLMs) are rapidly becoming critical infrastructure for enterprise applications, driving unprecedented demand for GPU-based inference services. A key operatio…