activity
20242026
collaborators

8 papers

cs.LG2026

Zero-order Parameter-free Optimization for LMO-based Methods: Novel Approach for Efficient Fine-tuning

Dmitriy Bystrov, Daniil Medyakov, Dmitry Bylinkin +1

Fine-tuning large language models (LLMs) has become a central application of modern optimization, enabling pretrained models to adapt to diverse downstream tasks and domain-specifi…

cs.LG2026

Scalable Knowledge Editing for Mixture-of-Experts LLMs via Tensor-Structured Updates

Roman Maksimov, Vladimir Aletov, Dmitry Bylinkin +3

Knowledge editing (KE) provides a lightweight alternative to repeated fine-tuning of LLMs. However, most existing KE methods target dense feed-forward layers, while modern LLMs inc…

cs.LG2026

Sign-SGD via Parameter-Free Optimization

Daniil Medyakov, Sergey Stanko, Gleb Molodtsov +4

Large language models have achieved major advances across domains, yet training them remains extremely resource-intensive. We revisit Sign-SGD, which serves both as a memory-effici…

cs.LG2026

Variance Reduction Methods Do Not Need to Compute Full Gradients: Improved Efficiency through Shuffling

Daniil Medyakov, Gleb Molodtsov, Savelii Chezhegov +2

Stochastic optimization algorithms are widely used for machine learning with large-scale data. However, their convergence often suffers from non-vanishing variance. Variance Reduct…

cs.LG2025

Bant: Byzantine Antidote via Trial Function and Trust Scores

Gleb Molodtsov, Daniil Medyakov, Sergey Skorik +6

Recent advancements in machine learning have improved performance while also increasing computational demands. While federated and distributed setups address these issues, their st…

math.OC2025

Shuffling Heuristic in Variational Inequalities: Establishing New Convergence Guarantees

Daniil Medyakov, Gleb Molodtsov, Grigoriy Evseev +2

Variational inequalities have gained significant attention in machine learning and optimization research. While stochastic methods for solving these problems typically assume indep…