Publications (109)
Commonsense Knowledge Mining from Pretrained Models
Joshua Feldman, Joe Davison, Alexander M. Rush
Latent Alignment and Variational Attention
Yuntian Deng, Yoon Kim, Justin Chiu +2
Simple Unsupervised Summarization by Contextual Matching
Jiawei Zhou, Alexander M. Rush
Critical Thinking: Which Kinds of Complexity Govern Optimal Reasoning Length?
Celine Lee, Alexander M. Rush, Keyon Vafa
A Controlled Study on Long Context Extension and Generalization in LLMs
Yi Lu, Jing Nathan Yan, Songlin Yang +6
Semi-Amortized Variational Autoencoders
Yoon Kim, Sam Wiseman, Andrew C. Miller +2
A Hierarchy of Graph Neural Networks Based on Learnable Local Features
Michael Lingzhi Li, Meng Dong, Jiawei Zhou +1
Datasets: A Community Library for Natural Language Processing
Quentin Lhoest, Albert Villanova del Moral, Yacine Jernite +29
Towards AI-Complete Question Answering: A Set of Prerequisite Toy Tasks
Jason Weston, Antoine Bordes, Sumit Chopra +4
On Adversarial Removal of Hypothesis-only Bias in Natural Language Inference
Yonatan Belinkov, Adam Poliak, Stuart M. Shieber +2
Avoiding Latent Variable Collapse With Generative Skip Models
Adji B. Dieng, Yoon Kim, Alexander M. Rush +1
Predicting Text Preference Via Structured Comparative Reasoning
Jing Nathan Yan, Tianqi Liu, Justin T Chiu +9
Named Tensor Notation
David Chiang, Alexander M. Rush, Boaz Barak
Movement Pruning: Adaptive Sparsity by Fine-Tuning
Victor Sanh, Thomas Wolf, Alexander M. Rush
Automating Botnet Detection with Graph Neural Networks
Jiawei Zhou, Zhiying Xu, Alexander M. Rush +1
Contextual Document Embeddings
John X. Morris, Alexander M. Rush
Adversarially Regularized Autoencoders
Jake Zhao, Yoon Kim, Kelly Zhang +2
LAN -- A materials notation for 2D layered assemblies
Georgios A. Tritsaris, Yiqi Xie, Alexander M. Rush +3
Dilated Convolutions for Modeling Long-Distance Genomic Dependencies
Ankit Gupta, Alexander M. Rush
OBELICS: An Open Web-Scale Filtered Dataset of Interleaved Image-Text Documents
Hugo Laurençon, Lucile Saulnier, Léo Tronchon +9
Bottom-Up Abstractive Summarization
Sebastian Gehrmann, Yuntian Deng, Alexander M. Rush
Compute-Constrained Data Selection
Junjie Oscar Yin, Alexander M. Rush
Distil-Whisper: Robust Knowledge Distillation via Large-Scale Pseudo Labelling
Sanchit Gandhi, Patrick von Platen, Alexander M. Rush
Pretraining Without Attention
Junxiong Wang, Jing Nathan Yan, Albert Gu +1
Multitask Prompted Training Enables Zero-Shot Task Generalization
Victor Sanh, Albert Webson, Colin Raffel +38
Image-to-Markup Generation with Coarse-to-Fine Attention
Yuntian Deng, Anssi Kanervisto, Jeffrey Ling +1
Parameter-Efficient Transfer Learning with Diff Pruning
Demi Guo, Alexander M. Rush, Yoon Kim
GenNI: Human-AI Collaboration for Data-Backed Text Generation
Hendrik Strobelt, Jambay Kinley, Robert Krueger +3
OpenNMT: Open-source Toolkit for Neural Machine Translation
Guillaume Klein, Yoon Kim, Yuntian Deng +3
MiniConf -- A Virtual Conference Framework
Alexander M. Rush, Hendrik Strobelt
A Neural Attention Model for Abstractive Sentence Summarization
Alexander M. Rush, Sumit Chopra, Jason Weston
Weightless: Lossy Weight Encoding For Deep Neural Network Compression
Brandon Reagen, Udit Gupta, Robert Adolf +4
Word Ordering Without Syntax
Allen Schmaltz, Alexander M. Rush, Stuart M. Shieber
The Mamba in the Llama: Distilling and Accelerating Hybrid Models
Junxiong Wang, Daniele Paliotta, Avner May +2
Explaining Patterns in Data with Language Models via Interpretable Autoprompting
Chandan Singh, John X. Morris, Jyoti Aneja +2
Unsupervised Text Deidentification
John X. Morris, Justin T. Chiu, Ramin Zabih +1
Pre-trained Summarization Distillation
Sam Shleifer, Alexander M. Rush
Entity Tracking Improves Cloze-style Reading Comprehension
Luong Hoang, Sam Wiseman, Alexander M. Rush
Latent Normalizing Flows for Discrete Sequences
Zachary M. Ziegler, Alexander M. Rush
Seq2Seq-Vis: A Visual Debugging Tool for Sequence-to-Sequence Models
Hendrik Strobelt, Sebastian Gehrmann, Michael Behrisch +3
Learning from others' mistakes: Avoiding dataset biases without modeling them
Victor Sanh, Thomas Wolf, Yonatan Belinkov +1
Unsupervised Recurrent Neural Network Grammars
Yoon Kim, Alexander M. Rush, Lei Yu +3
I Could've Asked That: Reformulating Unanswerable Questions
Wenting Zhao, Ge Gao, Claire Cardie +1
How Many Data Points is a Prompt Worth?
Teven Le Scao, Alexander M. Rush
Learning Neural Templates for Text Generation
Sam Wiseman, Stuart M. Shieber, Alexander M. Rush
Markup-to-Image Diffusion Models with Scheduled Sampling
Yuntian Deng, Noriyuki Kojima, Alexander M. Rush
MASR: A Modular Accelerator for Sparse RNNs
Udit Gupta, Brandon Reagen, Lillian Pentecost +5
HOP, UNION, GENERATE: Explainable Multi-hop Reasoning without Rationale Supervision
Wenting Zhao, Justin T. Chiu, Claire Cardie +1
Approximating Language Model Training Data from Weights
John X. Morris, Junjie Oscar Yin, Woojeong Kim +2
EdgeBERT: Sentence-Level Energy Optimizations for Latency-Aware Multi-Task NLP Inference
Thierry Tambe, Coleman Hooper, Lillian Pentecost +8
Torch-Struct: Deep Structured Prediction Library
Alexander M. Rush
Model Criticism for Long-Form Text Generation
Yuntian Deng, Volodymyr Kuleshov, Alexander M. Rush
Low-Rank Constraints for Fast Inference in Structured Models
Justin T. Chiu, Yuntian Deng, Alexander M. Rush
Low-Complexity Probing via Finding Subnetworks
Steven Cao, Victor Sanh, Alexander M. Rush
Language Model Inversion
John X. Morris, Wenting Zhao, Justin T. Chiu +2
A Tutorial on Deep Latent Variable Models of Natural Language
Yoon Kim, Sam Wiseman, Alexander M. Rush
Scaling Hidden Markov Language Models
Justin T. Chiu, Alexander M. Rush
A Tutorial on Dual Decomposition and Lagrangian Relaxation for Inference in Natural Language Processing
Alexander M. Rush, Michael Collins
Zephyr: Direct Distillation of LM Alignment
Lewis Tunstall, Edward Beeching, Nathan Lambert +11
Evaluate & Evaluation on the Hub: Better Best Practices for Data and Model Measurements
Leandro von Werra, Lewis Tunstall, Abhishek Thakur +16
Encoder-Agnostic Adaptation for Conditional Language Generation
Zachary M. Ziegler, Luke Melas-Kyriazi, Sebastian Gehrmann +1
NetFlowGen: Leveraging Generative Pre-training for Network Traffic Dynamics
Jiawei Zhou, Woojeong Kim, Zhiying Xu +2
Neural Linguistic Steganography
Zachary M. Ziegler, Yuntian Deng, Alexander M. Rush
Sequence-Level Mixed Sample Data Augmentation
Demi Guo, Yoon Kim, Alexander M. Rush
Diffusion Models Without Attention
Jing Nathan Yan, Jiatao Gu, Alexander M. Rush
Challenges in Trustworthy Human Evaluation of Chatbots
Wenting Zhao, Alexander M. Rush, Tanya Goyal
Cascaded Text Generation with Markov Transformers
Yuntian Deng, Alexander M. Rush
HuggingFace's Transformers: State-of-the-art Natural Language Processing
Thomas Wolf, Lysandre Debut, Victor Sanh +19
LSTMVis: A Tool for Visual Analysis of Hidden State Dynamics in Recurrent Neural Networks
Hendrik Strobelt, Sebastian Gehrmann, Hanspeter Pfister +1
The Efficiency Gap in Byte Modeling
Celine Lee, Jing Nathan Yan, Chen Liang +9
How much do language models memorize?
John X. Morris, Chawin Sitawarin, Chuan Guo +5
Teal: Learning-Accelerated Optimization of WAN Traffic Engineering
Zhiying Xu, Francis Y. Yan, Rachee Singh +3
Rationales for Sequential Predictions
Keyon Vafa, Yuntian Deng, David M. Blei +1
Block Pruning For Faster Transformers
François Lagunas, Ella Charlaix, Victor Sanh +1
MambaByte: Token-free Selective State Space Model
Junxiong Wang, Tushaar Gangavarapu, Jing Nathan Yan +1
Symbolic Planning and Code Generation for Grounded Dialogue
Justin T. Chiu, Wenting Zhao, Derek Chen +3
ESB: A Benchmark For Multi-Domain End-to-End Speech Recognition
Sanchit Gandhi, Patrick von Platen, Alexander M. Rush
Adapting Sequence Models for Sentence Correction
Allen Schmaltz, Yoon Kim, Alexander M. Rush +1
Lie-Access Neural Turing Machines
Greg Yang, Alexander M. Rush
Guess & Sketch: Language Model Guided Transpilation
Celine Lee, Abdulrahman Mahmoud, Michal Kurek +5
Character-Aware Neural Language Models
Yoon Kim, Yacine Jernite, David Sontag +1
OpenNMT: Neural Machine Translation Toolkit
Guillaume Klein, Yoon Kim, Yuntian Deng +3
PromptSource: An Integrated Development Environment and Repository for Natural Language Prompts
Stephen H. Bach, Victor Sanh, Zheng-Xin Yong +24
OverFill: Two-Stage Models for Efficient Language Model Decoding
Woojeong Kim, Junxiong Wang, Jing Nathan Yan +2
BLOOM: A 176B-Parameter Open-Access Multilingual Language Model
BigScience Workshop, :, Teven Le Scao +391
Latent Template Induction with Gumbel-CRFs
Yao Fu, Chuanqi Tan, Bin Bi +3
Adversarial Semantic Collisions
Congzheng Song, Alexander M. Rush, Vitaly Shmatikov
Entity Disambiguation via Fusion Entity Decoding
Junxiong Wang, Ali Mousavi, Omar Attia +5
Scaling Data-Constrained Language Models
Niklas Muennighoff, Alexander M. Rush, Boaz Barak +6
Sequence-to-Sequence Learning as Beam-Search Optimization
Sam Wiseman, Alexander M. Rush
Tree Prompting: Efficient Task Adaptation without Fine-Tuning
John X. Morris, Chandan Singh, Alexander M. Rush +2
Sentence-Level Grammatical Error Identification as Sequence-to-Sequence Correction
Allen Schmaltz, Yoon Kim, Alexander M. Rush +1
What is Learned in Visually Grounded Neural Syntax Acquisition
Noriyuki Kojima, Hadar Averbuch-Elor, Alexander M. Rush +1
Abductive Commonsense Reasoning Exploiting Mutually Exclusive Explanations
Wenting Zhao, Justin T. Chiu, Claire Cardie +1
M1: Towards Scalable Test-Time Compute with Mamba Reasoning Models
Junxiong Wang, Wen-Ding Li, Daniele Paliotta +3
Challenges in Data-to-Document Generation
Sam Wiseman, Stuart M. Shieber, Alexander M. Rush
End-to-End Content and Plan Selection for Data-to-Text Generation
Sebastian Gehrmann, Falcon Z. Dai, Henry Elder +1
Posterior Control of Blackbox Generation
Xiang Lisa Li, Alexander M. Rush
Compound Probabilistic Context-Free Grammars for Grammar Induction
Yoon Kim, Chris Dyer, Alexander M. Rush
Don't Take the Premise for Granted: Mitigating Artifacts in Natural Language Inference
Yonatan Belinkov, Adam Poliak, Stuart M. Shieber +2