activity
20242026
most citedDiT-Air: Revisiting the Efficiency of Diffusion Model Architecture Design in Text to Image Generation

1 citations · 1 across the 14 of their papers we have counts for

collaborators
Showing cs.LGShow all

5 papers · 1 filter

cs.LG2026

Scaling Muon for Diffusion Transformers

Chenghao Li, Xiao Han, Xinxin Huang +22

The matrix-aware optimizer Muon improves large model training by balancing updates across singular directions, yet its scaling behavior and end-to-end efficiency on large Diffusion…

cs.LG2026

UNIFUSION: Adapting Autoregressive Language Models into Discrete Diffusion under a Unified Reverse-Rate Objective

Xiaoyi Jiang, Jingyuan Li, Yixuan Jiang +4

Existing methods mainly adapt pretrained autoregressive (AR) language models to masked diffusion, whereas we directly adapt them to uniform-noise diffusion, where every token remai…

cs.LG2026

Mean-to-Score Discrete Diffusion: Posterior-Mean Denoisers for Score Entropy

Jingyuan Li, Xiaoyi Jiang, Yixuan Jiang +4

Score Entropy Discrete Diffusion (SEDD) parameterizes discrete reverse processes with unconstrained positive score ratios. While positivity guarantees nonnegative reverse jump rate…

cs.LG2026

Neural Continuous-Time Markov Chain: Discrete Diffusion via Decoupled Jump Timing and Direction

Jingyuan Li, Xiaoyi Jiang, Fukang Wen +5

Discrete diffusion models based on continuous-time Markov chains (CTMCs) have shown strong performance on language and discrete data generation, yet existing approaches typically p…

cs.LG2026

LoDAdaC: a unified local training-based decentralized framework with adaptive gradients and compressed communication

Wei Liu, Anweshit Panda, Ujwal Pandey +5

In the decentralized distributed learning, achieving fast convergence and low communication cost is essential for scalability and high efficiency. Adaptive gradient methods, such a…