1 paper · 1 filter
Xuanzhe Li, Ziyan Weng, Zhiyu Zhu +1
Transformer inference increasingly relies on specialized compiler and runtime support, while recent LLMs can generate nontrivial CUDA kernels. However, unconstrained generation gua…