1 paper · 1 filter
Qingfeng He, Zhui Zhu, Shangzhan Li +15
Training large models still relies on general-purpose frameworks such as Megatron-LM, whose generality tax constrains scenario-specific optimization and adds runtime overhead throu…