papers
Publications (13)
cs.LG2025
AdapterSwap: Continuous Training of LLMs with Data Removal and Access-Control Guarantees
William Fleshman, Aleem Khan, Marc Marone +1
cs.CL2024
Dated Data: Tracing Knowledge Cutoffs in Large Language Models
Jeffrey Cheng, Marc Marone, Orion Weller +3
cs.CL2022
Pretrained Models for Multilingual Federated Learning
Orion Weller, Marc Marone, Vladimir Braverman +2
cs.CL2025
Verifiable by Design: Aligning Language Models to Quote from Pre-Training Data
Jingyu Zhang, Marc Marone, Tianjian Li +2
cs.CL2023
StarCoder: may the source be with you!
Raymond Li, Loubna Ben Allal, Yangtian Zi +64
cs.CL2026
Seq vs Seq: An Open Suite of Paired Encoders and Decoders
Orion Weller, Kathryn Ricci, Marc Marone +3
cs.CL2025
mmBERT: A Modern Multilingual Encoder with Annealed Language Learning
Marc Marone, Orion Weller, William Fleshman +3
cs.CL2024
"According to ...": Prompting Language Models Improves Quoting from Pre-Training Data
Orion Weller, Marc Marone, Nathaniel Weir +3
cs.LG2023
Data Portraits: Recording Foundation Model Training Data
Marc Marone, Benjamin Van Durme
cs.CL2025
Certified Mitigation of Worst-Case LLM Copyright Infringement
Jingyu Zhang, Jiacan Yu, Marc Marone +2
cs.CL2021
Everything Is All It Takes: A Multipronged Strategy for Zero-Shot Cross-Lingual Information Extraction
Mahsa Yarmohammadi, Shijie Wu, Marc Marone +10
cs.SE2024
StarCoder 2 and The Stack v2: The Next Generation
Anton Lozhkov, Raymond Li, Loubna Ben Allal +63
cs.CL2019
Character Eyes: Seeing Language through Character-Level Taggers
Yuval Pinter, Marc Marone, Jacob Eisenstein