1 paper
Xiaoyi Yu, Enver Sangineto, Pei Fu +6
Diffusion Large Language Models (dLLMs) have emerged as an efficient alternative to autoregressive models, yet aligning them via Reinforcement Learning (RL) requires likelihood sur…