1 paper · 1 filter
Haohui Mai, Xiaoyan Guo, Xiangyun Ding +7
LLM coding agents can generate correct GPU kernels, but their performance still trails expert libraries. Reaching peak throughput requires coordinating low-level optimizations such…