NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (72)

cs.LG2021

Pitfalls in Machine Learning Research: Reexamining the Development Cycle

Stella Biderman, Walter J. Scheirer

cs.CL2022

Fooling MOSS Detection with Pretrained Language Models

Stella Biderman, Edward Raff

cs.SD2025

The Ghost in the Keys: A Disklavier Demo for Human-AI Musical Co-Creativity

Louis Bradshaw, Alexander Spangher, Stella Biderman +1

cs.CR2024

Holographic Global Convolutional Networks for Long-Range Prediction Tasks in Malware Detection

Mohammad Mahmudul Alam, Edward Raff, Stella Biderman +2

cs.CY2022

Data Governance in the Age of Large-Scale Data-Driven Language Technology

Yacine Jernite, Huu Nguyen, Stella Biderman +18

cs.CL2022

BigBIO: A Framework for Data-Centric Biomedical Natural Language Processing

Jason Alan Fries, Leon Weber, Natasha Seelam +40

cs.AI2026

When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation

Mubashara Akhtar, Anka Reuel, Prajna Soni +34

cs.AI2026

Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting

Avijit Ghosh, Anka Reuel, Jenny Chim +45

cs.LG2022

Multitask Prompted Training Enables Zero-Shot Task Generalization

Victor Sanh, Albert Webson, Colin Raffel +38

cs.CL2022

Quality at a Glance: An Audit of Web-Crawled Multilingual Datasets

Julia Kreutzer, Isaac Caswell, Lisa Wang +49

cs.CL2021

Cut the CARP: Fishing for zero-shot story evaluation

Shahbuland Matiana, JR Smith, Ryan Teehan +4

cs.CL2023

Crosslingual Generalization through Multitask Finetuning

Niklas Muennighoff, Thomas Wang, Lintang Sutawika +16

cs.CL2025

PolyPythias: Stability and Outliers across Fifty Language Model Pre-Training Runs

Oskar van der Wal, Pietro Lesci, Max Muller-Eberstein +4

cs.CL2023

Emergent and Predictable Memorization in Large Language Models

Stella Biderman, USVSN Sai Prashanth, Lintang Sutawika +4

cs.CL2024

Eagle and Finch: RWKV with Matrix-Valued States and Dynamic Recurrence

Bo Peng, Daniel Goldstein, Quentin Anthony +27

cs.AI2026

Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results

Jan Batzner, Sree Harsha Nelaturu, Damian Stachura +45

cs.LG2023

Recasting Self-Attention with Holographic Reduced Representations

Mohammad Mahmudul Alam, Edward Raff, Stella Biderman +2

cs.CL2026

Global PIQA: Evaluating Commonsense Reasoning Across 100+ Languages and Cultures

Tyler A. Chang, Catherine Arnett, Abdelrahman Sadallah +377

cs.CL2023

Stay on topic with Classifier-Free Guidance

Guillaume Sanchez, Honglu Fan, Alexander Spangher +3

cs.LG2023

Can Transformers Learn to Solve Problems Recursively?

Shizhuo Dylan Zhang, Curt Tigges, Stella Biderman +2

cs.CY2025

Towards Best Practices for Open Datasets for LLM Training

Stefan Baack, Stella Biderman, Kasia Odrozek +36

cs.LG2024

Grokking Group Multiplication with Cosets

Dashiell Stander, Qinan Yu, Honglu Fan +1

cs.CL2021

Towards a Formal Model of Narratives

Louis Castricato, Stella Biderman, Rogelio E. Cardona-Rivera +1

cs.AI2024

A Walsh Hadamard Derived Linear Vector Symbolic Architecture

Mohammad Mahmudul Alam, Alexander Oberle, Edward Raff +3

cs.CC2017

On the Sensitivity of k-Uniform Hypergraph Properties

Stella Biderman, Kevin Cuddy, Ang Li +1

cs.AI2025

Bridging the Data Provenance Gap Across Text, Speech and Video

Shayne Longpre, Nikhil Singh, Manuel Cherep +40

cs.AI2019

Magic: The Gathering is Turing Complete

Alex Churchill, Stella Biderman, Austin Herrick

cs.LG2025

The Responsible Foundation Model Development Cheatsheet: A Review of Tools & Resources

Shayne Longpre, Stella Biderman, Alon Albalak +20

cs.AI2026

Position: Don't Just "Fix it in Post": A Science of AI Must Study Training Dynamics

Stella Biderman, Mohammad Aflah Khan, Niloofar Mireshghallah +3

cs.CL2023

BLOOM+1: Adding Language Support to BLOOM for Zero-Shot Prompting

Zheng-Xin Yong, Hailey Schoelkopf, Niklas Muennighoff +12

cs.CL2023

The BigScience ROOTS Corpus: A 1.6TB Composite Multilingual Dataset

Hugo Laurençon, Lucile Saulnier, Thomas Wang +51

cs.LG2026

Bergson: An Open Source Library for Data Attribution

Lucia Quirke, Louis Jaburi, David Johnston +6

cs.LG2025

Eliciting Latent Predictions from Transformers with the Tuned Lens

Nora Belrose, Igor Ostrovsky, Lev McKinney +5

cs.SD2025

Scaling Self-Supervised Representation Learning for Symbolic Piano Performance

Louis Bradshaw, Honglu Fan, Alexander Spangher +2

cs.CY2024

On the Societal Impact of Open Foundation Models

Sayash Kapoor, Rishi Bommasani, Kevin Klyman +22

cs.CL2023

RWKV: Reinventing RNNs for the Transformer Era

Bo Peng, Eric Alcaide, Quentin Anthony +31

cs.CL2023

The Goldilocks of Pragmatic Understanding: Fine-Tuning Strategy Matters for Implicature Resolution by LLMs

Laura Ruis, Akbir Khan, Stella Biderman +3

cs.LG2024

LLM Circuit Analyses Are Consistent Across Training and Scale

Curt Tigges, Michael Hanna, Qinan Yu +1

cs.CL2025

Recite, Reconstruct, Recollect: Memorization in LMs as a Multifaceted Phenomenon

USVSN Sai Prashanth, Alvin Deng, Kyle O'Brien +9

cs.CL2022

EleutherAI: Going Beyond "Open Science" to "Science in the Open"

Jason Phang, Herbie Bradley, Leo Gao +2

cs.CL2026

Lessons from the Trenches on Reproducible Evaluation of Language Models

Stella Biderman, Hailey Schoelkopf, Lintang Sutawika +27

cs.CL2024

Suppressing Pink Elephants with Direct Principle Feedback

Louis Castricato, Nathan Lile, Suraj Anand +3

cs.CL2023

BLOOM: A 176B-Parameter Open-Access Multilingual Language Model

BigScience Workshop, :, Teven Le Scao +391

cs.CV2022

VQGAN-CLIP: Open Domain Image Generation and Editing with Natural Language Guidance

Katherine Crowson, Stella Biderman, Daniel Kornis +4

cs.LG2025

Why Has Predicting Downstream Capabilities of Frontier AI Models with Scale Remained Elusive?

Rylan Schaeffer, Hailey Schoelkopf, Brando Miranda +6

cs.LG2026

Adversarial Samples Are Not Created Equal

Jennifer Crawford, Amol Khanna, Fred Lu +4

cs.LG2025

LEACE: Perfect linear concept erasure in closed form

Nora Belrose, David Schneider-Joseph, Shauli Ravfogel +3

cs.CL2025

Explaining and Mitigating Crosslingual Tokenizer Inequities

Catherine Arnett, Tyler A. Chang, Stella Biderman +1

cs.CL2022

What Language Model to Train if You Have One Million GPU Hours?

Teven Le Scao, Thomas Wang, Daniel Hesslow +16

cs.LG2025

Open Problems in Mechanistic Interpretability

Lee Sharkey, Bilal Chughtai, Joshua Batson +26

cs.CL2025

When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research

Guijin Son, Jiwoo Hong, Honglu Fan +8

cs.CL2022

GPT-NeoX-20B: An Open-Source Autoregressive Language Model

Sid Black, Stella Biderman, Eric Hallahan +14

cs.CL2022

Documenting Geographically and Contextually Diverse Data Sources: The BigScience Catalogue of Language Data and Resources

Angelina McMillan-Major, Zaid Alyafeai, Stella Biderman +15

cs.CL2024

Consent in Crisis: The Rapid Decline of the AI Data Commons

Shayne Longpre, Robert Mahari, Ariel Lee +46

cs.LG2026

Deep Ignorance: Filtering Pretraining Data Builds Tamper-Resistant Safeguards into Open-Weight LLMs

Kyle O'Brien, Stephen Casper, Quentin Anthony +7

cs.CY2026

Video Deepfake Abuse: How Company Choices Predictably Shape Misuse Patterns

Max Kamachee, Stephen Casper, Michelle L. Ding +4

cs.CL2025

The Common Pile v0.1: An 8TB Dataset of Public Domain and Openly Licensed Text

Nikhil Kandpal, Brian Lester, Colin Raffel +24

cs.CL2023

GAIA Search: Hugging Face and Pyserini Interoperability for NLP Training Data Exploration

Aleksandra Piktus, Odunayo Ogundepo, Christopher Akiki +6

cs.CL2023

Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models

Aarohi Srivastava, Abhinav Rastogi, Abhishek Rao +448

cs.AI2020

Magic: the Gathering is as Hard as Arithmetic

Stella Biderman

cs.CL2022

Datasheet for the Pile

Stella Biderman, Kieran Bicheno, Leo Gao

cs.CL2020

The Pile: An 800GB Dataset of Diverse Text for Language Modeling

Leo Gao, Stella Biderman, Sid Black +9

cs.LG2026

LoRA-Muon: Spectral Steepest Descent on the Low-Rank Manifold

Franz Louis Cesista, Katherine Crowson, Cédric Simal +1

cs.AI2026

Faults in Our Formal Benchmarking: Dataset Defects and Evaluation Failures in Lean Theorem Proving

Pawan Sasanka Ammanamanchi, Siddharth Bhat, Stella Biderman

cs.LG2026

Quantifying the Effect of Test Set Contamination on Generative Evaluations

Rylan Schaeffer, Joshua Kazdan, Baber Abbasi +8

cs.DC2024

The Case for Co-Designing Model Architectures with Hardware

Quentin Anthony, Jacob Hatef, Deepak Narayanan +6

cs.CY2026

Who Evaluates AI's Social Impacts? Mapping Coverage and Gaps in First and Third Party Evaluations

Anka Reuel, Avijit Ghosh, Jenny Chim +32

cs.CL2024

Llemma: An Open Language Model For Mathematics

Zhangir Azerbayev, Hailey Schoelkopf, Keiran Paster +6

cs.CL2024

KMMLU: Measuring Massive Multitask Language Understanding in Korean

Guijin Son, Hanwool Lee, Sungdong Kim +6

cs.CL2024

Transformer-Based Models Are Not Yet Perfect At Learning to Emulate Structural Recursion

Dylan Zhang, Curt Tigges, Zory Zhang +3

cs.CL2023

Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling

Stella Biderman, Hailey Schoelkopf, Quentin Anthony +10

cs.CL2026

Capability Provenance in Language Models: A Case Study in Social Reasoning

Glenn Matlin, Chandreyi Chakraborty, Saehee Eom +8