1 paper
Baodi Shan, Mauricio Araya-Polo, Barbara Chapman
Distributed GPU applications increasingly rely on kernel-level, cross-node coordination to reduce launch overheads and improve compute-communication overlap, but such support is la…