1 paper
Siyuan Yan, Mo Zhu, Guo-qing Jiang +8
The escalating demand for efficient decoding in large language models (LLMs) is particularly critical for reasoning-intensive architectures like OpenAI-o3 and DeepSeek-R1, which de…