1 paper · 1 filter
Yitong Ding, Jiawei Huang, Renyang Guan +7
Modern LLM (large language model) workloads increasingly rely on optimized GPU kernels through hardware-software co-design. These kernels achieve high-performance through fine-grai…