1 paper · 1 filter
Tao He, Guang Huang, Yu Yang +5
Large language models (LLMs) exhibit remarkable reasoning capabilities across diverse downstream tasks. However, their autoregressive nature leads to substantial inference latency,…