1 paper
Abhishek Ghosh, Ajay Nayak, Ashish Panwar +1
Machine learning (ML) workloads launch hundreds to thousands of short-running GPU kernels per iteration. With GPU compute throughput growing rapidly, CPU-side launch latency of ker…