Showing cs.CLShow all
2 papers · 1 filter
cs.CL2026
Reducing Pretraining-Generation Mismatch in Diffusion Language Models
Xiaocheng Lu, Huabin Liu, Song Guo +1
Autoregressive language models align training and use: generation conditions on a clean prompt, and training predicts future tokens from clean left context. Diffusion language mode…
cs.CL2026
OPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language Models
Xiaocheng Lu, Hualei Zhang, Shuhan Guo +8
Diffusion language models (dLLMs) can predict many tokens in parallel, but accurate generation still requires many iterative denoising steps. Few-step distillation accelerates deco…