1 paper · 1 filter
Minseok Seo, Xuan Truong Nguyen, Seok Joong Hwang +18
Accelerating end-to-end inference of transformer-based large language models (LLMs) is a critical component of AI services in datacenters. However, diverse compute characteristics…