2 papers
cs.LG2025
ACCO: Accumulate While You Communicate for Communication-Overlapped Sharded LLM Training
Adel Nabli, Louis Fournier, Pierre Erbacher +3
Training LLMs relies on distributed implementations using multiple GPUs to compute gradients in parallel with sharded optimizers. However, synchronizing gradients in data parallel…
cs.LG2025
Zebra: In-Context Generative Pretraining for Solving Parametric PDEs
Louis Serrano, Armand Kassaï Koupaï, Thomas X Wang +2
Solving time-dependent parametric partial differential equations (PDEs) is challenging for data-driven methods, as these models must adapt to variations in parameters such as coeff…