2 papers
cs.DC2024
TokenRing: An Efficient Parallelism Framework for Infinite-Context LLMs via Bidirectional Communication
Zongwu Wang, Fangxin Liu, Mingshuai Li +1
Efficient parallelization of Large Language Models (LLMs) with long sequences is essential but challenging due to their significant computational and memory demands, particularly s…
cs.PF2024
In-Situ Techniques on GPU-Accelerated Data-Intensive Applications
Yi Ju, Mingshuai Li, Adalberto Perez +5
The computational power of High-Performance Computing (HPC) systems is constantly increasing, however, their input/output (IO) performance grows relatively slowly, and their storag…