1 paper
Minseok Seo, Xuan Truong Nguyen, Seok Joong Hwang +18
Accelerating end-to-end inference of transformer-based large language models (LLMs) is a critical component of AI services in datacenters. However, diverse compute characteristics…