1 paper · 1 filter
Dengyu Wu, Clement Ruah, Jiechen Chen +2
Autoregressive (AR) large language models (LLMs) are inherently inefficient at inference time because each generated token requires accessing the full set of model parameters, lead…