papers

Publications (109)

cs.CL2019

Commonsense Knowledge Mining from Pretrained Models

Joshua Feldman, Joe Davison, Alexander M. Rush

stat.ML2018

Latent Alignment and Variational Attention

Yuntian Deng, Yoon Kim, Justin Chiu +2

cs.CL2019

Simple Unsupervised Summarization by Contextual Matching

Jiawei Zhou, Alexander M. Rush

cs.AI2025

Critical Thinking: Which Kinds of Complexity Govern Optimal Reasoning Length?

Celine Lee, Alexander M. Rush, Keyon Vafa

cs.CL2024

A Controlled Study on Long Context Extension and Generalization in LLMs

Yi Lu, Jing Nathan Yan, Songlin Yang +6

stat.ML2018

Semi-Amortized Variational Autoencoders

Yoon Kim, Sam Wiseman, Andrew C. Miller +2

cs.LG2019

A Hierarchy of Graph Neural Networks Based on Learnable Local Features

Michael Lingzhi Li, Meng Dong, Jiawei Zhou +1

cs.CL2021

Datasets: A Community Library for Natural Language Processing

Quentin Lhoest, Albert Villanova del Moral, Yacine Jernite +29

cs.AI2015

Towards AI-Complete Question Answering: A Set of Prerequisite Toy Tasks

Jason Weston, Antoine Bordes, Sumit Chopra +4

cs.CL2019

On Adversarial Removal of Hypothesis-only Bias in Natural Language Inference

Yonatan Belinkov, Adam Poliak, Stuart M. Shieber +2

stat.ML2019

Avoiding Latent Variable Collapse With Generative Skip Models

Adji B. Dieng, Yoon Kim, Alexander M. Rush +1

cs.CL2024

Predicting Text Preference Via Structured Comparative Reasoning

Jing Nathan Yan, Tianqi Liu, Justin T Chiu +9

cs.LG2023

Named Tensor Notation

David Chiang, Alexander M. Rush, Boaz Barak

cs.CL2020

Movement Pruning: Adaptive Sparsity by Fine-Tuning

Victor Sanh, Thomas Wolf, Alexander M. Rush

cs.CR2020

Automating Botnet Detection with Graph Neural Networks

Jiawei Zhou, Zhiying Xu, Alexander M. Rush +1

cs.CL2024

Contextual Document Embeddings

John X. Morris, Alexander M. Rush

cs.LG2018

Adversarially Regularized Autoencoders

Jake Zhao, Yoon Kim, Kelly Zhang +2

cond-mat.mtrl-sci2020

LAN -- A materials notation for 2D layered assemblies

Georgios A. Tritsaris, Yiqi Xie, Alexander M. Rush +3

q-bio.GN2017

Dilated Convolutions for Modeling Long-Distance Genomic Dependencies

Ankit Gupta, Alexander M. Rush

cs.IR2023

OBELICS: An Open Web-Scale Filtered Dataset of Interleaved Image-Text Documents

Hugo Laurençon, Lucile Saulnier, Léo Tronchon +9

cs.CL2018

Bottom-Up Abstractive Summarization

Sebastian Gehrmann, Yuntian Deng, Alexander M. Rush

cs.LG2025

Compute-Constrained Data Selection

Junjie Oscar Yin, Alexander M. Rush

cs.CL2023

Distil-Whisper: Robust Knowledge Distillation via Large-Scale Pseudo Labelling

Sanchit Gandhi, Patrick von Platen, Alexander M. Rush

cs.CL2023

Pretraining Without Attention

Junxiong Wang, Jing Nathan Yan, Albert Gu +1

cs.LG2022

Multitask Prompted Training Enables Zero-Shot Task Generalization

Victor Sanh, Albert Webson, Colin Raffel +38

cs.CV2017

Image-to-Markup Generation with Coarse-to-Fine Attention

Yuntian Deng, Anssi Kanervisto, Jeffrey Ling +1

cs.CL2021

Parameter-Efficient Transfer Learning with Diff Pruning

Demi Guo, Alexander M. Rush, Yoon Kim

cs.CL2021

GenNI: Human-AI Collaboration for Data-Backed Text Generation

Hendrik Strobelt, Jambay Kinley, Robert Krueger +3

cs.CL2017

OpenNMT: Open-source Toolkit for Neural Machine Translation

Guillaume Klein, Yoon Kim, Yuntian Deng +3

cs.HC2020

MiniConf -- A Virtual Conference Framework

Alexander M. Rush, Hendrik Strobelt

cs.CL2015

A Neural Attention Model for Abstractive Sentence Summarization

Alexander M. Rush, Sumit Chopra, Jason Weston

cs.LG2017

Weightless: Lossy Weight Encoding For Deep Neural Network Compression

Brandon Reagen, Udit Gupta, Robert Adolf +4

cs.CL2016

Word Ordering Without Syntax

Allen Schmaltz, Alexander M. Rush, Stuart M. Shieber

cs.LG2025

The Mamba in the Llama: Distilling and Accelerating Hybrid Models

Junxiong Wang, Daniele Paliotta, Avner May +2

cs.LG2023

Explaining Patterns in Data with Language Models via Interpretable Autoprompting

Chandan Singh, John X. Morris, Jyoti Aneja +2

cs.CL2022

Unsupervised Text Deidentification

John X. Morris, Justin T. Chiu, Ramin Zabih +1

cs.CL2020

Pre-trained Summarization Distillation

Sam Shleifer, Alexander M. Rush

cs.CL2018

Entity Tracking Improves Cloze-style Reading Comprehension

Luong Hoang, Sam Wiseman, Alexander M. Rush

stat.ML2019

Latent Normalizing Flows for Discrete Sequences

Zachary M. Ziegler, Alexander M. Rush

cs.CL2018

Seq2Seq-Vis: A Visual Debugging Tool for Sequence-to-Sequence Models

Hendrik Strobelt, Sebastian Gehrmann, Michael Behrisch +3

cs.CL2020

Learning from others' mistakes: Avoiding dataset biases without modeling them

Victor Sanh, Thomas Wolf, Yonatan Belinkov +1

cs.CL2019

Unsupervised Recurrent Neural Network Grammars

Yoon Kim, Alexander M. Rush, Lei Yu +3

cs.CL2024

I Could've Asked That: Reformulating Unanswerable Questions

Wenting Zhao, Ge Gao, Claire Cardie +1

cs.LG2021

How Many Data Points is a Prompt Worth?

Teven Le Scao, Alexander M. Rush

cs.CL2019

Learning Neural Templates for Text Generation

Sam Wiseman, Stuart M. Shieber, Alexander M. Rush

cs.LG2022

Markup-to-Image Diffusion Models with Scheduled Sampling

Yuntian Deng, Noriyuki Kojima, Alexander M. Rush

eess.SP2019

MASR: A Modular Accelerator for Sparse RNNs

Udit Gupta, Brandon Reagen, Lillian Pentecost +5

cs.CL2023

HOP, UNION, GENERATE: Explainable Multi-hop Reasoning without Rationale Supervision

Wenting Zhao, Justin T. Chiu, Claire Cardie +1

cs.CL2025

Approximating Language Model Training Data from Weights

John X. Morris, Junjie Oscar Yin, Woojeong Kim +2

cs.AR2021

EdgeBERT: Sentence-Level Energy Optimizations for Latency-Aware Multi-Task NLP Inference

Thierry Tambe, Coleman Hooper, Lillian Pentecost +8

cs.CL2020

Torch-Struct: Deep Structured Prediction Library

Alexander M. Rush

cs.CL2022

Model Criticism for Long-Form Text Generation

Yuntian Deng, Volodymyr Kuleshov, Alexander M. Rush

cs.CL2022

Low-Rank Constraints for Fast Inference in Structured Models

Justin T. Chiu, Yuntian Deng, Alexander M. Rush

cs.CL2021

Low-Complexity Probing via Finding Subnetworks

Steven Cao, Victor Sanh, Alexander M. Rush

cs.CL2023

Language Model Inversion

John X. Morris, Wenting Zhao, Justin T. Chiu +2

cs.CL2019

A Tutorial on Deep Latent Variable Models of Natural Language

Yoon Kim, Sam Wiseman, Alexander M. Rush

cs.CL2020

Scaling Hidden Markov Language Models

Justin T. Chiu, Alexander M. Rush

cs.CL2014

A Tutorial on Dual Decomposition and Lagrangian Relaxation for Inference in Natural Language Processing

Alexander M. Rush, Michael Collins

cs.LG2023

Zephyr: Direct Distillation of LM Alignment

Lewis Tunstall, Edward Beeching, Nathan Lambert +11

cs.LG2022

Evaluate & Evaluation on the Hub: Better Best Practices for Data and Model Measurements

Leandro von Werra, Lewis Tunstall, Abhishek Thakur +16

cs.CL2019

Encoder-Agnostic Adaptation for Conditional Language Generation

Zachary M. Ziegler, Luke Melas-Kyriazi, Sebastian Gehrmann +1

cs.LG2024

NetFlowGen: Leveraging Generative Pre-training for Network Traffic Dynamics

Jiawei Zhou, Woojeong Kim, Zhiying Xu +2

cs.CL2019

Neural Linguistic Steganography

Zachary M. Ziegler, Yuntian Deng, Alexander M. Rush

cs.CL2020

Sequence-Level Mixed Sample Data Augmentation

Demi Guo, Yoon Kim, Alexander M. Rush

cs.CV2023

Diffusion Models Without Attention

Jing Nathan Yan, Jiatao Gu, Alexander M. Rush

cs.HC2024

Challenges in Trustworthy Human Evaluation of Chatbots

Wenting Zhao, Alexander M. Rush, Tanya Goyal

cs.CL2020

Cascaded Text Generation with Markov Transformers

Yuntian Deng, Alexander M. Rush

cs.CL2020

HuggingFace's Transformers: State-of-the-art Natural Language Processing

Thomas Wolf, Lysandre Debut, Victor Sanh +19

cs.CL2017

LSTMVis: A Tool for Visual Analysis of Hidden State Dynamics in Recurrent Neural Networks

Hendrik Strobelt, Sebastian Gehrmann, Hanspeter Pfister +1

cs.LG2026

The Efficiency Gap in Byte Modeling

Celine Lee, Jing Nathan Yan, Chen Liang +9

cs.CL2025

How much do language models memorize?

John X. Morris, Chawin Sitawarin, Chuan Guo +5

cs.NI2024

Teal: Learning-Accelerated Optimization of WAN Traffic Engineering

Zhiying Xu, Francis Y. Yan, Rachee Singh +3

cs.CL2021

Rationales for Sequential Predictions

Keyon Vafa, Yuntian Deng, David M. Blei +1

cs.LG2021

Block Pruning For Faster Transformers

François Lagunas, Ella Charlaix, Victor Sanh +1

cs.CL2024

MambaByte: Token-free Selective State Space Model

Junxiong Wang, Tushaar Gangavarapu, Jing Nathan Yan +1

cs.CL2023

Symbolic Planning and Code Generation for Grounded Dialogue

Justin T. Chiu, Wenting Zhao, Derek Chen +3

cs.CL2022

ESB: A Benchmark For Multi-Domain End-to-End Speech Recognition

Sanchit Gandhi, Patrick von Platen, Alexander M. Rush

cs.CL2017

Adapting Sequence Models for Sentence Correction

Allen Schmaltz, Yoon Kim, Alexander M. Rush +1

cs.NE2017

Lie-Access Neural Turing Machines

Greg Yang, Alexander M. Rush

cs.SE2024

Guess & Sketch: Language Model Guided Transpilation

Celine Lee, Abdulrahman Mahmoud, Michal Kurek +5

cs.CL2015

Character-Aware Neural Language Models

Yoon Kim, Yacine Jernite, David Sontag +1

cs.CL2018

OpenNMT: Neural Machine Translation Toolkit

Guillaume Klein, Yoon Kim, Yuntian Deng +3

cs.LG2022

PromptSource: An Integrated Development Environment and Repository for Natural Language Prompts

Stephen H. Bach, Victor Sanh, Zheng-Xin Yong +24

cs.AI2025

OverFill: Two-Stage Models for Efficient Language Model Decoding

Woojeong Kim, Junxiong Wang, Jing Nathan Yan +2

cs.CL2023

BLOOM: A 176B-Parameter Open-Access Multilingual Language Model

BigScience Workshop, :, Teven Le Scao +391

cs.CL2020

Latent Template Induction with Gumbel-CRFs

Yao Fu, Chuanqi Tan, Bin Bi +3

cs.CL2020

Adversarial Semantic Collisions

Congzheng Song, Alexander M. Rush, Vitaly Shmatikov

cs.CL2024

Entity Disambiguation via Fusion Entity Decoding

Junxiong Wang, Ali Mousavi, Omar Attia +5

cs.CL2025

Scaling Data-Constrained Language Models

Niklas Muennighoff, Alexander M. Rush, Boaz Barak +6

cs.CL2016

Sequence-to-Sequence Learning as Beam-Search Optimization

Sam Wiseman, Alexander M. Rush

cs.CL2023

Tree Prompting: Efficient Task Adaptation without Fine-Tuning

John X. Morris, Chandan Singh, Alexander M. Rush +2

cs.CL2016

Sentence-Level Grammatical Error Identification as Sequence-to-Sequence Correction

Allen Schmaltz, Yoon Kim, Alexander M. Rush +1

cs.CL2020

What is Learned in Visually Grounded Neural Syntax Acquisition

Noriyuki Kojima, Hadar Averbuch-Elor, Alexander M. Rush +1

cs.CL2023

Abductive Commonsense Reasoning Exploiting Mutually Exclusive Explanations

Wenting Zhao, Justin T. Chiu, Claire Cardie +1

cs.LG2025

M1: Towards Scalable Test-Time Compute with Mamba Reasoning Models

Junxiong Wang, Wen-Ding Li, Daniele Paliotta +3

cs.CL2017

Challenges in Data-to-Document Generation

Sam Wiseman, Stuart M. Shieber, Alexander M. Rush

cs.CL2018

End-to-End Content and Plan Selection for Data-to-Text Generation

Sebastian Gehrmann, Falcon Z. Dai, Henry Elder +1

cs.CL2020

Posterior Control of Blackbox Generation

Xiang Lisa Li, Alexander M. Rush

cs.CL2020

Compound Probabilistic Context-Free Grammars for Grammar Induction

Yoon Kim, Chris Dyer, Alexander M. Rush

cs.CL2019

Don't Take the Premise for Granted: Mitigating Artifacts in Natural Language Inference

Yonatan Belinkov, Adam Poliak, Stuart M. Shieber +2