1 paper · 1 filter
Mingyu Lee, Akshat Ramachandran, Souvik Kundu +1
The inference efficiency of diffusion large language models (dLLMs) is constrained by two challenges: bidirectional attention precludes efficient KV-cache reuse, while increasing d…