1 paper
Xuan Luo, Weizhi Wang, Xifeng Yan
Various layer-skipping methods have been proposed to accelerate token generation in large language models (LLMs). However, limited attention has been paid to a fundamental question…