1 paper
Hong Li, Zhen Zhou, Honggang Zhang +4
Data-parallel (DP) training with synchronous all-reduce is a dominant paradigm for full-parameter fine-tuning of large language models (LLMs). While parameter synchronization guara…