1 paper · 1 filter
Vishnu Teja Kunde, Fatemeh Doudi, Mahdi Farahbakhsh +3
Reinforcement learning (RL) has been effective for post-training autoregressive (AR) language models, but extending these methods to diffusion language models (DLMs) is challenging…