collaborators

5 papers

cs.LG2026

One-Step Gradient Delay is Not a Barrier for Large-Scale Asynchronous Pipeline Parallel LLM Pretraining

Philip Zmushko, Egor Petrov, Nursultan Abdullaev +2

Modern large-scale LLM pretraining benefits from utilizing Pipeline Parallelism; however, synchronous implementations leave GPUs idle during pipeline bubbles, wasting computational…

cs.LG2026

Sign-SGD via Parameter-Free Optimization

Daniil Medyakov, Sergey Stanko, Gleb Molodtsov +4

Large language models have achieved major advances across domains, yet training them remains extremely resource-intensive. We revisit Sign-SGD, which serves both as a memory-effici…

math.OC2025

Shuffling Heuristic in Variational Inequalities: Establishing New Convergence Guarantees

Daniil Medyakov, Gleb Molodtsov, Grigoriy Evseev +2

Variational inequalities have gained significant attention in machine learning and optimization research. While stochastic methods for solving these problems typically assume indep…

cs.LG2025

Closing the Curvature Gap: Full Transformer Hessians

Egor Petrov, Nikita Kiselev, Vladislav Meshkov +1

The optimization landscape of Transformer models remains poorly understood despite their widespread adoption. While recent studies have derived curvature properties for isolated se…

cs.LG2025

Leveraging Coordinate Momentum in SignSGD and Muon: Memory-Optimized Zero-Order

Egor Petrov, Grigoriy Evseev, Aleksey Antonov +4

Fine-tuning Large Language Models (LLMs) is essential for adapting pre-trained models to downstream tasks. Yet traditional first-order optimizers such as Stochastic Gradient Descen…