2 papers
cs.CL2025
Learning to Parallel: Accelerating Diffusion Large Language Models via Learnable Parallel Decoding
Wenrui Bao, Zhiben Chen, Dan Xu +1
Autoregressive decoding in large language models (LLMs) requires sequential steps for tokens, fundamentally limiting inference throughput. Recent diffusion-bas…
cs.LG2025
Taming LLMs by Scaling Learning Rates with Gradient Grouping
Siyuan Li, Juanxi Tian, Zedong Wang +4
Training large language models (LLMs) poses challenges due to their massive scale and heterogeneous architectures. While adaptive optimizers like AdamW help address gradient variat…