1 paper
Zhixin Ou, Peng Liang, Jianchen Han +2
Dynamic sequences with varying lengths have been widely used in the training of Transformer-based large language models (LLMs). However, current training frameworks adopt a pre-def…