3 papers
cs.LG2025
LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models
Fengqi Zhu, Rongzhen Wang, Shen Nie +8
While Masked Diffusion Models (MDMs), such as LLaDA, present a promising paradigm for language modeling, there has been relatively little effort in aligning these models with human…
cs.LG2025
Scaling Diffusion Transformers Efficiently via P
Chenyu Zheng, Xinyu Zhang, Rongzhen Wang +5
Diffusion Transformers have emerged as the foundation for vision generative models, but their scalability is limited by the high cost of hyperparameter (HP) tuning at large scales.…
cs.LG2025
A Theory for Conditional Generative Modeling on Multiple Data Sources
Rongzhen Wang, Yan Zhang, Chenyu Zheng +2
The success of large generative models has driven a paradigm shift, leveraging massive multi-source data to enhance model capabilities. However, the interaction among these sources…