1 paper · 1 filter
Guoliang He, Eiko Yoneki
Large language models (LLMs) are remarked by their substantial computational requirements. To mitigate the cost, researchers develop specialized CUDA kernels, which often fuse seve…