papers

Publications (13)

cs.LG2025

AdapterSwap: Continuous Training of LLMs with Data Removal and Access-Control Guarantees

William Fleshman, Aleem Khan, Marc Marone +1

cs.CL2024

Dated Data: Tracing Knowledge Cutoffs in Large Language Models

Jeffrey Cheng, Marc Marone, Orion Weller +3

cs.CL2022

Pretrained Models for Multilingual Federated Learning

Orion Weller, Marc Marone, Vladimir Braverman +2

cs.CL2025

Verifiable by Design: Aligning Language Models to Quote from Pre-Training Data

Jingyu Zhang, Marc Marone, Tianjian Li +2

cs.CL2023

StarCoder: may the source be with you!

Raymond Li, Loubna Ben Allal, Yangtian Zi +64

cs.CL2026

Seq vs Seq: An Open Suite of Paired Encoders and Decoders

Orion Weller, Kathryn Ricci, Marc Marone +3

cs.CL2025

mmBERT: A Modern Multilingual Encoder with Annealed Language Learning

Marc Marone, Orion Weller, William Fleshman +3

cs.CL2024

"According to ...": Prompting Language Models Improves Quoting from Pre-Training Data

Orion Weller, Marc Marone, Nathaniel Weir +3

cs.LG2023

Data Portraits: Recording Foundation Model Training Data

Marc Marone, Benjamin Van Durme

cs.CL2025

Certified Mitigation of Worst-Case LLM Copyright Infringement

Jingyu Zhang, Jiacan Yu, Marc Marone +2

cs.CL2021

Everything Is All It Takes: A Multipronged Strategy for Zero-Shot Cross-Lingual Information Extraction

Mahsa Yarmohammadi, Shijie Wu, Marc Marone +10

cs.SE2024

StarCoder 2 and The Stack v2: The Next Generation

Anton Lozhkov, Raymond Li, Loubna Ben Allal +63

cs.CL2019

Character Eyes: Seeing Language through Character-Level Taggers

Yuval Pinter, Marc Marone, Jacob Eisenstein