1 paper
Han Meng, Danny Willow Liu, Dong Li
Layerwise offloading reduces the GPU memory footprint of large diffusion transformer (DiT) inference by prefetching upcoming layers from host memory, but its effectiveness hinges o…