1 paper
Hossein Rajabzadeh, Maryam Dialameh, Chul B. Park +2
Autoregressive large language models (LLMs) are bottlenecked by sequential decoding, where each new token typically requires executing all transformer layers. Existing dynamic-dept…