NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (34)

cs.LG2021

Scaling Ensemble Distribution Distillation to Many Classes with Proxy Targets

Max Ryabinin, Andrey Malinin, Mark Gales

cs.LG2022

Moshpit SGD: Communication-Efficient Decentralized Training on Heterogeneous Unreliable Devices

Max Ryabinin, Eduard Gorbunov, Vsevolod Plokhotnyuk +1

cs.CL2024

SpecExec: Massively Parallel Speculative Decoding for Interactive LLM Inference on Consumer Devices

Ruslan Svirschevski, Avner May, Zhuoming Chen +3

cs.CL2025

Sequoia: Scalable, Robust, and Hardware-aware Speculative Decoding

Zhuoming Chen, Avner May, Ruslan Svirschevski +4

cs.DC2024

INTELLECT-1 Technical Report

Sami Jaghouar, Jack Min Ong, Manveer Basra +9

cs.LG2023

Secure Distributed Training at Scale

Eduard Gorbunov, Alexander Borzunov, Michael Diskin +1

cs.CL2024

Mind Your Format: Towards Consistent Evaluation of In-Context Learning Improvements

Anton Voronov, Lena Wolf, Max Ryabinin

cs.CR2025

TOPLOC: A Locality Sensitive Hashing Scheme for Trustless Verifiable Inference

Jack Min Ong, Matthew Di Ferrante, Aaron Pazdera +5

cs.LG2024

Label Privacy in Split Learning for Large Models with Parameter-Efficient Training

Philip Zmushko, Marat Mansurov, Ruslan Svirschevski +3

cs.LG2023

Petals: Collaborative Inference and Fine-tuning of Large Models

Alexander Borzunov, Dmitry Baranchuk, Tim Dettmers +5

cs.CV2023

Is This Loss Informative? Faster Text-to-Image Customization by Tracking Objective Dynamics

Anton Voronov, Mikhail Khoroshikh, Artem Babenko +1

cs.CL2023

BLOOM: A 176B-Parameter Open-Access Multilingual Language Model

BigScience Workshop, :, Teven Le Scao +391

cs.LG2026

Asynchronous Reasoning: Training-Free Interactive Thinking LLMs

George Yakushev, Nataliia Babina, Masoud Vahid Dastgerdi +4

cs.LG2026

Mashup Learning: Faster Finetuning by Remixing Past Checkpoints

Sofia Maria Lo Cicero Vaina, Artem Chumachenko, Max Ryabinin

cs.LG2025

FFT-based Dynamic Subspace Selection for Low-Rank Adaptive Optimization of Large Language Models

Ionut-Vlad Modoranu, Mher Safaryan, Erik Schultheis +3

cs.CL2025

Multilingual Language Model Pretraining using Machine-translated Data

Jiayi Wang, Yao Lu, Maurice Weber +5

cs.LG2021

Distributed Deep Learning in Open Collaborations

Michael Diskin, Alexey Bukhtiyarov, Max Ryabinin +13

cs.CY2025

Towards Best Practices for Open Datasets for LLM Training

Stefan Baack, Stella Biderman, Kasia Odrozek +36

cs.CL2020

Embedding Words in Non-Vector Space with Unsupervised Graph Learning

Max Ryabinin, Sergei Popov, Liudmila Prokhorenkova +1

cs.DC2023

SWARM Parallelism: Training Large Models Can Be Surprisingly Communication-Efficient

Max Ryabinin, Tim Dettmers, Michael Diskin +1

cs.CV2023

Hypernymy Understanding Evaluation of Text-to-Image Models via WordNet Hierarchy

Anton Baryshnikov, Max Ryabinin

cs.CL2021

It's All in the Heads: Using Attention Heads as a Baseline for Cross-Lingual Transfer in Commonsense Reasoning

Alexey Tikhonov, Max Ryabinin

cs.LG2022

Training Transformers Together

Alexander Borzunov, Max Ryabinin, Tim Dettmers +5

cs.CL2025

AutoJudge: Judge Decoding Without Manual Annotation

Roman Garipov, Fedor Velikonivtsev, Ivan Ermakov +3

cs.CL2024

RedPajama: an Open Dataset for Training Large Language Models

Maurice Weber, Daniel Fu, Quentin Anthony +16

cs.CL2022

RuCoLA: Russian Corpus of Linguistic Acceptability

Vladislav Mikhailov, Tatiana Shamardina, Max Ryabinin +3

cs.LG2023

Distributed Methods with Compressed Communication for Solving Variational Inequalities, with Theoretical Guarantees

Aleksandr Beznosikov, Peter Richtárik, Michael Diskin +2

cs.LG2023

Distributed Inference and Fine-tuning of Large Language Models Over The Internet

Alexander Borzunov, Max Ryabinin, Artem Chumachenko +5

cs.CL2024

Multilingual Pretraining Using a Large Corpus Machine-Translated from a Single Source Language

Jiayi Wang, Yao Lu, Maurice Weber +4

cs.CL2024

The Hallucinations Leaderboard -- An Open Effort to Measure Hallucinations in Large Language Models

Giwon Hong, Aryo Pradipta Gema, Rohit Saxena +8

cs.LG2023

FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU

Ying Sheng, Lianmin Zheng, Binhang Yuan +11

cs.LG2026

Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking

Ravi Ghadia, Maksim Abraham, Sergei Vorobyov +1

cs.DC2020

Towards Crowdsourced Training of Large Neural Networks using Decentralized Mixture-of-Experts

Max Ryabinin, Anton Gusev

cs.LG2026

Escaping the Verifier: Learning to Reason via Demonstrations

Locke Cai, Max Ryabinin, Ivan Provilkov