NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (334)

cs.CL2023

On the Off-Target Problem of Zero-Shot Multilingual Neural Machine Translation

Liang Chen, Shuming Ma, Dongdong Zhang +2

cs.LG2022

Task-Specific Expert Pruning for Sparse Mixture-of-Experts

Tianyu Chen, Shaohan Huang, Yuan Xie +5

cs.CL2019

Can Monolingual Pretrained Models Help Cross-Lingual Classification?

Zewen Chi, Li Dong, Furu Wei +2

cs.CL2015

Multi-Document Summarization via Discriminative Summary Reranking

Xiaojun Wan, Ziqiang Cao, Furu Wei +2

cs.CL2026

Black-Box On-Policy Distillation of Large Language Models

Tianzhu Ye, Li Dong, Zewen Chi +3

cs.CL2022

Controllable Natural Language Generation with Contrastive Prefixes

Jing Qian, Li Dong, Yelong Shen +2

cs.CL2023

Retentive Network: A Successor to Transformer for Large Language Models

Yutao Sun, Li Dong, Shaohan Huang +5

cs.CL2024

xRAG: Extreme Context Compression for Retrieval-augmented Generation with One Token

Xin Cheng, Xun Wang, Xingxing Zhang +5

cs.CL2026

Online Experiential Learning for Language Models

Tianzhu Ye, Li Dong, Qingxiu Dong +3

cs.CL2021

UniSpeech-SAT: Universal Speech Representation Learning with Speaker Aware Pre-Training

Sanyuan Chen, Yu Wu, Chengyi Wang +8

cs.CL2019

Visualizing and Understanding the Effectiveness of BERT

Yaru Hao, Li Dong, Furu Wei +1

cs.CL2026

Computer Environments Elicit General Agentic Intelligence in LLMs

Daixuan Cheng, Shaohan Huang, Yuxian Gu +6

cs.CL2025

Thinking Augmented Pre-training

Liang Wang, Nan Yang, Shaohan Huang +2

cs.CL2020

Scheduled DropHead: A Regularization Method for Transformer Models

Wangchunshu Zhou, Tao Ge, Ke Xu +2

cs.CL2025

Examining False Positives under Inference Scaling for Mathematical Reasoning

Yu Wang, Nan Yang, Liang Wang +2

cs.CL2024

Improving Domain Adaptation through Extended-Text Reading Comprehension

Ting Jiang, Shaohan Huang, Shengyue Luo +8

cs.CL2021

Improving Non-autoregressive Generation with Mixup Training

Ting Jiang, Shaohan Huang, Zihan Zhang +6

cs.CL2026

Sparse-BitNet: 1.58-bit LLMs are Naturally Friendly to Semi-Structured Sparsity

Di Zhang, Xun Wu, Shaohan Huang +9

cs.CL2024

K-Level Reasoning: Establishing Higher Order Beliefs in Large Language Models for Strategic Reasoning

Yadong Zhang, Shaoguang Mao, Tao Ge +4

cs.CR2022

THE-X: Privacy-Preserving Transformer Inference with Homomorphic Encryption

Tianyu Chen, Hangbo Bao, Shaohan Huang +6

cs.CL2021

Adapt-and-Distill: Developing Small, Fast and Effective Pretrained Language Models for Domains

Yunzhi Yao, Shaohan Huang, Wenhui Wang +2

cs.CL2023

SpeechLM: Enhanced Speech Pre-Training with Unpaired Textual Data

Ziqiang Zhang, Sanyuan Chen, Long Zhou +8

cs.CL2025

Geometric-Mean Policy Optimization

Yuzhong Zhao, Yue Liu, Junpeng Liu +9

cs.CL2023

Language Is Not All You Need: Aligning Perception with Language Models

Shaohan Huang, Li Dong, Wenhui Wang +15

cs.CL2022

Neural Label Search for Zero-Shot Multi-Lingual Extractive Summarization

Ruipeng Jia, Xingxing Zhang, Yanan Cao +3

cs.IR2025

GeAR: Generation Augmented Retrieval

Haoyu Liu, Shaohan Huang, Jianfeng Liu +6

cs.IR2023

SimLM: Pre-training with Representation Bottleneck for Dense Passage Retrieval

Liang Wang, Nan Yang, Xiaolong Huang +5

cs.CL2025

Imagine while Reasoning in Space: Multimodal Visualization-of-Thought

Chengzu Li, Wenshan Wu, Huanyu Zhang +5

cs.CL2020

Improving Grammatical Error Correction with Machine Translation Pairs

Wangchunshu Zhou, Tao Ge, Chang Mu +3

cs.CL2018

Attention-Guided Answer Distillation for Machine Reading Comprehension

Minghao Hu, Yuxing Peng, Furu Wei +4

cs.CL2024

Q-Sparse: All Large Language Models can be Fully Sparsely-Activated

Hongyu Wang, Shuming Ma, Ruiping Wang +1

cs.LG2023

Are More Layers Beneficial to Graph Transformers?

Haiteng Zhao, Shuming Ma, Dongdong Zhang +2

cs.CL2024

HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition

Yuxuan Liu, Tianchi Yang, Shaohan Huang +6

cs.IR2017

Faithful to the Original: Fact Aware Neural Abstractive Summarization

Ziqiang Cao, Furu Wei, Wenjie Li +1

cs.IR2015

TGSum: Build Tweet Guided Multi-Document Summarization Dataset

Ziqiang Cao, Chengyao Chen, Wenjie Li +3

cs.CV2022

Swin Transformer V2: Scaling Up Capacity and Resolution

Ze Liu, Han Hu, Yutong Lin +9

cs.CL2022

WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing

Sanyuan Chen, Chengyi Wang, Zhengyang Chen +15

cs.CV2026

UniM: A Unified Any-to-Any Interleaved Multimodal Benchmark

Yanlin Li, Minghui Guo, Kaiwen Zhang +13

cs.CL2018

Neural Melody Composition from Lyrics

Hangbo Bao, Shaohan Huang, Furu Wei +5

cs.CL2023

Speculative Decoding: Exploiting Speculative Execution for Accelerating Seq2seq Generation

Heming Xia, Tao Ge, Peiyi Wang +3

cs.CL2024

Towards Optimal Learning of Language Models

Yuxian Gu, Li Dong, Yaru Hao +3

cs.CL2024

Multilingual E5 Text Embeddings: A Technical Report

Liang Wang, Nan Yang, Xiaolong Huang +3

cs.CL2022

On the Representation Collapse of Sparse Mixture of Experts

Zewen Chi, Li Dong, Shaohan Huang +9

cs.CL2021

s2s-ft: Fine-Tuning Pretrained Transformer Encoders for Sequence-to-Sequence Learning

Hangbo Bao, Li Dong, Wenhui Wang +2

cs.CL2025

Preference Optimization for Reasoning with Pseudo Feedback

Fangkai Jiao, Geyang Guo, Xingxing Zhang +3

cs.CL2021

VT-SSum: A Benchmark Dataset for Video Transcript Segmentation and Summarization

Tengchao Lv, Lei Cui, Momcilo Vasilijevic +1

cs.CL2022

A Length-Extrapolatable Transformer

Yutao Sun, Li Dong, Barun Patra +6

cs.CL2023

Democratizing Reasoning Ability: Tailored Learning from Large Language Model

Zhaoyang Wang, Shaohan Huang, Yuxuan Liu +8

cs.CV2022

BEiT: BERT Pre-Training of Image Transformers

Hangbo Bao, Li Dong, Songhao Piao +1

cs.CL2020

BERT Loses Patience: Fast and Robust Inference with Early Exit

Wangchunshu Zhou, Canwen Xu, Tao Ge +3

cs.CL2020

LayoutLM: Pre-training of Text and Layout for Document Image Understanding

Yiheng Xu, Minghao Li, Lei Cui +3

cs.AI2025

The Era of Agentic Organization: Learning to Organize with Language Models

Zewen Chi, Li Dong, Qingxiu Dong +4

cs.CL2024

Multi-Head Mixture-of-Experts

Xun Wu, Shaohan Huang, Wenhui Wang +1

cs.CL2021

Consistency Regularization for Cross-Lingual Fine-Tuning

Bo Zheng, Li Dong, Shaohan Huang +7

cs.CV2023

Generic-to-Specific Distillation of Masked Autoencoders

Wei Huang, Zhiliang Peng, Li Dong +3

cs.SD2022

Joint Pre-Training with Speech and Bilingual Text for Direct Speech to Speech Translation

Kun Wei, Long Zhou, Ziqiang Zhang +5

cs.CL2022

EdgeFormer: A Parameter-Efficient Transformer for On-Device Seq2seq Generation

Tao Ge, Si-Qing Chen, Furu Wei

cs.CL2025

Autoregressive Speech Synthesis without Vector Quantization

Lingwei Meng, Long Zhou, Shujie Liu +9

cs.CV2026

Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking

Shengqiong Wu, Bobo Li, Xinkai Wang +6

cs.CL2025

Semi-Parametric Retrieval via Binary Bag-of-Tokens Index

Jiawei Zhou, Li Dong, Furu Wei +1

cs.CL2017

Neural Question Generation from Text: A Preliminary Study

Qingyu Zhou, Nan Yang, Furu Wei +3

cs.LG2022

TorchScale: Transformers at Scale

Shuming Ma, Hongyu Wang, Shaohan Huang +8

cs.CL2021

Improving Pretrained Cross-Lingual Language Models via Self-Labeled Word Alignment

Zewen Chi, Li Dong, Bo Zheng +4

cs.CL2023

Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers

Damai Dai, Yutao Sun, Li Dong +4

cs.CL2025

ShifCon: Enhancing Non-Dominant Language Capabilities with a Shift-based Multilingual Contrastive Framework

Hengyuan Zhang, Chenming Shang, Sizhe Wang +6

cs.CL2023

Advancing Multilingual Pre-training: TRIP Triangular Document-level Pre-training for Multilingual Language Models

Hongyuan Lu, Haoyang Huang, Shuming Ma +3

cs.CL2023

Augmenting Language Models with Long-Term Memory

Weizhi Wang, Li Dong, Hao Cheng +4

cs.CL2025

Reward Reasoning Model

Jiaxin Guo, Zewen Chi, Li Dong +4

eess.AS2023

VATLM: Visual-Audio-Text Pre-Training with Unified Masked Prediction for Speech Representation Learning

Qiushi Zhu, Long Zhou, Ziqiang Zhang +7

cs.CL2022

Transforming Wikipedia into Augmented Data for Query-Focused Summarization

Haichao Zhu, Li Dong, Furu Wei +2

cs.CL2021

Zero-shot Cross-lingual Transfer of Neural Machine Translation with Multilingual Pretrained Encoders

Guanhua Chen, Shuming Ma, Yun Chen +5

cs.CL2017

Selective Encoding for Abstractive Sentence Summarization

Qingyu Zhou, Nan Yang, Furu Wei +1

cs.CV2026

DocReward: A Document Reward Model for Structuring and Stylizing

Junpeng Liu, Yuzhong Zhao, Bowen Cao +17

cs.CV2025

Next Block Prediction: Video Generation via Semi-Autoregressive Modeling

Shuhuai Ren, Shuming Ma, Xu Sun +1

cs.CL2022

CROP: Zero-shot Cross-lingual Named Entity Recognition with Multilingual Labeled Sequence Translation

Jian Yang, Shaohan Huang, Shuming Ma +6

cs.CL2022

Supervision-Guided Codebooks for Masked Prediction in Speech Pre-training

Chengyi Wang, Yiming Wang, Yu Wu +4

cs.CL2021

Self-Attention Attribution: Interpreting Information Interactions Inside Transformer

Yaru Hao, Li Dong, Furu Wei +1

cs.IR2023

Fine-Tuning LLaMA for Multi-Stage Text Retrieval

Xueguang Ma, Liang Wang, Nan Yang +2

cs.CL2024

Improving Text Embeddings with Large Language Models

Liang Wang, Nan Yang, Xiaolong Huang +3

cs.CL2025

Data Selection via Optimal Control for Language Models

Yuxian Gu, Li Dong, Hongning Wang +4

eess.AS2021

Separating Long-Form Speech with Group-Wise Permutation Invariant Training

Wangyou Zhang, Zhuo Chen, Naoyuki Kanda +8

cs.CL2022

Distilled Dual-Encoder Model for Vision-Language Understanding

Zekun Wang, Wenhui Wang, Haichao Zhu +3

cs.CL2025

Reasoning with Exploration: An Entropy Perspective

Daixuan Cheng, Shaohan Huang, Xuekai Zhu +4

cs.CL2021

InfoXLM: An Information-Theoretic Framework for Cross-Lingual Language Model Pre-Training

Zewen Chi, Li Dong, Furu Wei +7

cs.CV2022

A Unified View of Masked Image Modeling

Zhiliang Peng, Li Dong, Hangbo Bao +2

cs.CL2022

Why does Self-Supervised Learning for Speech Recognition Benefit Speaker Recognition?

Sanyuan Chen, Yu Wu, Chengyi Wang +8

cs.CL2021

Allocating Large Vocabulary Capacity for Cross-lingual Language Model Pre-training

Bo Zheng, Li Dong, Shaohan Huang +5

cs.CL2026

Two Pathways to Truthfulness: On the Intrinsic Encoding of LLM Hallucinations

Wen Luo, Guangyue Peng, Wei Li +8

cs.SD2026

VIBEVOICE-ASR Technical Report

Zhiliang Peng, Jianwei Yu, Yaoyao Chang +21

cs.CL2026

Scaling Data Difficulty: Improving Coding Models via Reinforcement Learning on Fresh and Challenging Problems

Zongqian Li, Tengchao Lv, Shaohan Huang +8

cs.CL2021

MT6: Multilingual Pretrained Text-to-Text Transformer with Translation Pairs

Zewen Chi, Li Dong, Shuming Ma +3

cs.CL2021

Jointly Learning to Repair Code and Generate Commit Message

Jiaqi Bai, Long Zhou, Ambrosio Blanco +4

cs.CL2024

ResLoRA: Identity Residual Mapping in Low-Rank Adaption

Shuhua Shi, Shaohan Huang, Minghui Song +7

cs.CL2023

Optimizing Prompts for Text-to-Image Generation

Yaru Hao, Zewen Chi, Li Dong +1

cs.CL2020

XLM-T: Scaling up Multilingual Machine Translation with Pretrained Cross-lingual Transformer Encoders

Shuming Ma, Jian Yang, Haoyang Huang +10

cs.LG2025

BitNet Distillation

Xun Wu, Shaohan Huang, Wenhui Wang +4

cs.CL2024

Context-DPO: Aligning Language Models for Context-Faithfulness

Baolong Bi, Shaohan Huang, Yiwei Wang +11

cs.CL2024

Not All Metrics Are Guilty: Improving NLG Evaluation by Diversifying References

Tianyi Tang, Hongyuan Lu, Yuchen Eleanor Jiang +5

cs.CL2022

Prototypical Calibration for Few-shot Learning of Language Models

Zhixiong Han, Yaru Hao, Li Dong +2

cs.CL2021

DeltaLM: Encoder-Decoder Pre-training for Language Generation and Translation by Augmenting Pretrained Multilingual Encoders

Shuming Ma, Li Dong, Shaohan Huang +6