1 paper
Yunxiang Zhang, Ping Yu, Jianyu Wang +5
Recent large language models (LLMs) can generate custom CUDA kernels that appear to outperform PyTorch on benchmarks such as KernelBench. Building upon this foundational framework,…