papers

Publications (406)

cs.SD2023

Diffsound: Discrete Diffusion Model for Text-to-sound Generation

Dongchao Yang, Jianwei Yu, Helin Wang +4

cs.SD2025

U-Codec: Ultra Low Frame-rate Neural Speech Codec for Fast High-fidelity Speech Generation

Xusheng Yang, Long Zhou, Wenfu Wang +6

cs.CV2023

Bridging the Gap between Synthetic and Authentic Images for Multimodal Machine Translation

Wenyu Guo, Qingkai Fang, Dong Yu +1

eess.AS2021

Towards Robust Speaker Verification with Target Speaker Enhancement

Chunlei Zhang, Meng Yu, Chao Weng +1

eess.AS2023

Unifying Robustness and Fidelity: A Comprehensive Study of Pretrained Generative Methods for Speech Enhancement in Adverse Conditions

Heming Wang, Meng Yu, Hao Zhang +5

cs.CL2020

Robust Dialogue Utterance Rewriting as Sequence Tagging

Jie Hao, Linfeng Song, Liwei Wang +3

cs.SD2020

PitchNet: Unsupervised Singing Voice Conversion with Pitch Adversarial Network

Chengqi Deng, Chengzhu Yu, Heng Lu +2

cs.CL2024

OpenWebVoyager: Building Multimodal Web Agents via Iterative Real-World Exploration, Feedback and Optimization

Hongliang He, Wenlin Yao, Kaixin Ma +5

eess.AS2020

End-to-End Multi-Look Keyword Spotting

Meng Yu, Xuan Ji, Bo Wu +2

cond-mat.mes-hall2015

Gate-tunable superconducting quantum interference devices of PbS nanowires

Hong-Seok Kim, Bum-Kyu Kim, Yiming Yang +4

cs.CL2025

Exploring Stability-Plasticity Trade-offs for Continual Named Entity Recognition

Duzhen Zhang, Chenxing Li, Jiahua Dong +2

cs.CL2025

Don't Throw Away Your Pretrained Model

Shangbin Feng, Wenhao Yu, Yike Wang +3

eess.AS2020

Transferring Source Style in Non-Parallel Voice Conversion

Songxiang Liu, Yuewen Cao, Shiyin Kang +5

cs.CL2020

Automatic Summarization of Open-Domain Podcast Episodes

Kaiqiang Song, Chen Li, Xiaoyang Wang +2

cs.CL2026

WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models

Rui Wang, Ce Zhang, Jun-Yu Ma +10

cs.CL2023

Faithful Question Answering with Monte-Carlo Planning

Ruixin Hong, Hongming Zhang, Hong Zhao +2

eess.AS2020

Audio-visual Multi-channel Recognition of Overlapped Speech

Jianwei Yu, Bo Wu, Rongzhi Gu +7

cs.SD2022

Automatic Prosody Annotation with Pre-Trained Text-Speech Model

Ziqian Dai, Jianwei Yu, Yan Wang +5

cs.CL2022

Efficient Zero-shot Event Extraction with Context-Definition Alignment

Hongming Zhang, Wenlin Yao, Dong Yu

cs.CL2025

EconProver: Towards More Economical Test-Time Scaling for Automated Theorem Proving

Mukai Li, Linfeng Song, Zhenwen Liang +5

cs.CL2019

Improving Pre-Trained Multilingual Models with Vocabulary Expansion

Hai Wang, Dian Yu, Kai Sun +2

cs.SD2026

Covo-Audio Technical Report

Wenfu Wang, Chenxing Li, Liqiang Zhang +23

cs.CL2025

Attention Entropy is a Key Factor: An Analysis of Parallel Context Encoding with Full-attention-based Pre-trained Language Models

Zhisong Zhang, Yan Wang, Xinting Huang +5

cs.CL2024

NaturalConv: A Chinese Dialogue Dataset Towards Multi-turn Topic-driven Conversation

Xiaoyang Wang, Chen Li, Jianqiao Zhao +1

eess.AS2019

Time Domain Audio Visual Speech Separation

Jian Wu, Yong Xu, Shi-Xiong Zhang +4

cs.CL2025

UniGist: Towards General and Hardware-aligned Sequence-level Long Context Compression

Chenlong Deng, Zhisong Zhang, Kelong Mao +6

eess.AS2023

Hybrid AHS: A Hybrid of Kalman Filter and Deep Learning for Acoustic Howling Suppression

Hao Zhang, Meng Yu, Yuzhong Wu +2

cond-mat.supr-con2018

Fabrication and Characterization of Superconducting Quantum Interference Device using (Bi_{1-x}Sb_x)_2Se_3 Topological Insulator Nanoribbons

Nam-Hee Kim, Hong-Seok Kim, Yiming Yang +3

cond-mat.supr-con2025

Anomalous Fraunhofer patterns in CdAs Josephson Junctions

Rak-Hee Kim, Yeongmin Jang, Bob M. Wang +2

cs.CL2019

Improving Machine Reading Comprehension with General Reading Strategies

Kai Sun, Dian Yu, Dong Yu +1

cs.SD2017

Recognizing Multi-talker Speech with Permutation Invariant Training

Dong Yu, Xuankai Chang, Yanmin Qian

cs.CL2017

Permutation Invariant Training of Deep Models for Speaker-Independent Multi-talker Speech Separation

Dong Yu, Morten Kolbæk, Zheng-Hua Tan +1

cs.CL2022

Hierarchical Context Tagging for Utterance Rewriting

Lisa Jin, Linfeng Song, Lifeng Jin +2

cs.SD2021

MIMO Self-attentive RNN Beamformer for Multi-speaker Speech Separation

Xiyun Li, Yong Xu, Meng Yu +4

cond-mat.mes-hall2021

Nanosecond dynamics in intrinsic topological insulator revealed by time-resolved optical reflectivity

Adam L. Gross, Yasen Hou, Antonio Rossi +2

cs.CL2025

Scaling Synthetic Data Creation with 1,000,000,000 Personas

Tao Ge, Xin Chan, Xiaoyang Wang +3

eess.AS2023

Neural Network Augmented Kalman Filter for Robust Acoustic Howling Suppression

Yixuan Zhang, Hao Zhang, Meng Yu +1

cond-mat.mtrl-sci2004

Variable range hopping conduction in semiconductor nanocrystal solids

Dong Yu, Congjun Wang, Brian L. Wehrenberg +1

cs.SD2026

SemanticVocoder: Bridging Audio Generation and Audio Understanding via Semantic Latents

Zeyu Xie, Chenxing Li, Qiao Jin +6

cs.CL2025

Router-Tuning: A Simple and Effective Approach for Enabling Dynamic-Depth in Transformers

Shwai He, Tao Ge, Guoheng Sun +3

cs.AI2022

MetaLogic: Logical Reasoning Explanations with Fine-Grained Structure

Yinya Huang, Hongming Zhang, Ruixin Hong +3

eess.AS2022

Robust Disentangled Variational Speech Representation Learning for Zero-shot Voice Conversion

Jiachen Lian, Chunlei Zhang, Dong Yu

cs.LG2013

Feature Learning in Deep Neural Networks - Studies on Speech Recognition Tasks

Dong Yu, Michael L. Seltzer, Jinyu Li +2

eess.AS2019

Maximizing Mutual Information for Tacotron

Peng Liu, Xixin Wu, Shiyin Kang +3

cs.CL2026

Locas: Your Models are Principled Initializers of Locally-Supported Parametric Memories

Sidi Lu, Zhenwen Liang, Dongyang Ma +3

eess.AS2024

Advancing Multi-talker ASR Performance with Large Language Models

Mohan Shi, Zengrui Jin, Yaoxun Xu +6

cs.MM2025

Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation

Yongqi Wang, Chunlei Zhang, Hangting Chen +2

cs.CL2022

Integrating Lattice-Free MMI into End-to-End Speech Recognition

Jinchuan Tian, Jianwei Yu, Chao Weng +2

cond-mat.supr-con2016

Very Strong Superconducting Proximity Effects in PbS Semiconductor Nanowires

Bum-Kyu Kim, Hong-Seok Kim, Yiming Yang +3

cs.CL2026

Verified Critical Step Optimization for LLM Agents

Mukai Li, Qingcheng Zeng, Tianqing Fang +5

eess.AS2023

Deep Learning for Joint Acoustic Echo and Acoustic Howling Suppression in Hybrid Meetings

Hao Zhang, Meng Yu, Dong Yu

cs.SD2025

From Continuous to Discrete: Cross-Domain Collaborative General Speech Enhancement via Hierarchical Language Models

Zhaoxi Mu, Rilin Chen, Andong Li +3

cs.CL2019

Modeling Fluency and Faithfulness for Diverse Neural Machine Translation

Yang Feng, Wanying Xie, Shuhao Gu +4

eess.AS2022

BDDM: Bilateral Denoising Diffusion Models for Fast and High-Quality Speech Synthesis

Max W. Y. Lam, Jun Wang, Dan Su +1

cs.CL2024

ParallelSpec: Parallel Drafter for Efficient Speculative Decoding

Zilin Xiao, Hongming Zhang, Tao Ge +3

cs.CL2021

Self-Teaching Machines to Read and Comprehend with Large-Scale Multi-Subject Question-Answering Data

Dian Yu, Kai Sun, Dong Yu +1

cs.SD2025

Dopamine Audiobook: A Training-free MLLM Agent for Emotional and Immersive Audiobook Generation

Yan Rong, Shan Yang, Chenxing Li +2

cs.SD2025

Video-to-Audio Generation with Hidden Alignment

Manjie Xu, Chenxing Li, Xinyi Tu +5

cs.LG2025

Improving LLM General Preference Alignment via Optimistic Online Mirror Descent

Yuheng Zhang, Dian Yu, Tao Ge +5

cs.CL2024

Evaluating Moral Beliefs across LLMs through a Pluralistic Framework

Xuelin Liu, Yanfei Zhu, Shucheng Zhu +3

cond-mat.mes-hall2022

Schottky Electric Field Induced Circular Photogalvanic Effect in Cd3As2 Nanobelts

Bob Minyu Wang, Yuqing Zhu, Henry Clark Travaglini +2

cs.SD2020

Improving Reverberant Speech Training Using Diffuse Acoustic Simulation

Zhenyu Tang, Lianwu Chen, Bo Wu +2

cs.CL2022

LAE: Language-Aware Encoder for Monolingual and Multilingual ASR

Jinchuan Tian, Jianwei Yu, Chunlei Zhang +3

eess.AS2020

Directional ASR: A New Paradigm for E2E Multi-Speaker Speech Recognition with Source Localization

Aswin Shanmugam Subramanian, Chao Weng, Shinji Watanabe +4

cond-mat.mtrl-sci2016

Spin Generation Via Bulk Spin Current in Three Dimensional Topological Insulators

Xingyue Peng, Yiming Yang, Rajiv R. P. Singh +2

eess.AS2021

Effective Low-Cost Time-Domain Audio Separation Using Globally Attentive Locally Recurrent Networks

Max W. Y. Lam, Jun Wang, Dan Su +1

cs.CL2025

Information-Theoretic Complementary Prompts for Improved Continual Text Classification

Duzhen Zhang, Yong Ren, Chenxing Li +2

cs.CL2024

InFoBench: Evaluating Instruction Following Ability in Large Language Models

Yiwei Qin, Kaiqiang Song, Yebowen Hu +7

cs.LO2025

Towards Solving More Challenging IMO Problems via Decoupled Reasoning and Proving

Zhenwen Liang, Linfeng Song, Yang Li +4

eess.AS2022

Joint Neural AEC and Beamforming with Double-Talk Detection

Vinay Kothapally, Yong Xu, Meng Yu +2

eess.AS2021

MetricNet: Towards Improved Modeling For Non-Intrusive Speech Quality Assessment

Meng Yu, Chunlei Zhang, Yong Xu +2

cs.CL2025

UNCLE: Benchmarking Uncertainty Expressions in Long-Form Generation

Ruihan Yang, Caiqi Zhang, Zhisong Zhang +4

eess.AS2025

VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining

Jianheng Zhuo, Yifan Yang, Yiwen Shao +4

cs.CL2025

LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory

Di Wu, Hongwei Wang, Wenhao Yu +3

cs.SD2019

End-to-End Multi-Channel Speech Separation

Rongzhi Gu, Jian Wu, Shi-Xiong Zhang +6

eess.AS2021

Tune-In: Training Under Negative Environments with Interference for Attention Networks Simulating Cocktail Party Effect

Jun Wang, Max W. Y. Lam, Dan Su +1

eess.AS2022

VCVTS: Multi-speaker Video-to-Speech synthesis via cross-modal knowledge transfer from voice conversion

Disong Wang, Shan Yang, Dan Su +3

cs.AI2025

Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards

Xiaoyuan Liu, Tian Liang, Zhiwei He +6

eess.AS2021

Latency-Controlled Neural Architecture Search for Streaming Speech Recognition

Liqiang He, Shulin Feng, Dan Su +1

eess.AS2021

Self-supervised Text-independent Speaker Verification using Prototypical Momentum Contrastive Learning

Wei Xia, Chunlei Zhang, Chao Weng +2

cs.CL2026

Do Gender Cues Affect LLM Value Trade-offs? Evidence from a Controlled Decision Benchmark

Yangyang Liu, Dong Yu, Pengyuan Liu

cs.CL2020

MART: Memory-Augmented Recurrent Transformer for Coherent Video Paragraph Captioning

Jie Lei, Liwei Wang, Yelong Shen +3

cs.CL2021

Connect-the-Dots: Bridging Semantics between Words and Definitions via Aligning Word Sense Inventories

Wenlin Yao, Xiaoman Pan, Lifeng Jin +3

cs.CL2024

MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning

Fuxiao Liu, Xiaoyang Wang, Wenlin Yao +5

eess.AS2025

SongPrep: A Preprocessing Framework and End-to-end Model for Full-song Structure Parsing and Lyrics Transcription

Wei Tan, Shun Lei, Huaicheng Zhang +6

cs.CL2024

Conceptual and Unbiased Reasoning in Language Models

Ben Zhou, Hongming Zhang, Sihao Chen +5

cs.CL2025

OpenCharacter: Training Customizable Role-Playing LLMs with Large-Scale Synthetic Personas

Xiaoyang Wang, Hongming Zhang, Tao Ge +3

cs.CL2025

Atomic Calibration of LLMs in Long-Form Generations

Caiqi Zhang, Ruihan Yang, Zhisong Zhang +4

eess.AS2021

TeCANet: Temporal-Contextual Attention Network for Environment-Aware Speech Dereverberation

Helin Wang, Bo Wu, Lianwu Chen +7

cs.CL2024

Teaching LLMs to Refine with Tools

Dian Yu, Yuheng Zhang, Jiahao Xu +5

cs.CL2024

Learn Beyond The Answer: Training Language Models with Reflection for Mathematical Reasoning

Zhihan Zhang, Tao Ge, Zhenwen Liang +5

cs.SE2025

RepoGraph: Enhancing AI Software Engineering with Repository-level Code Graph

Siru Ouyang, Wenhao Yu, Kaixin Ma +6

cs.CL2024

Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing

Ye Tian, Baolin Peng, Linfeng Song +4

cs.AI2026

Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification

Yuxuan Wan, Tianqing Fang, Zaitang Li +5

cs.SD2026

AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models

Junqi Zhao, Chenxing Li, Jinzheng Zhao +4

cs.CL2020

Multiplex Word Embeddings for Selectional Preference Acquisition

Hongming Zhang, Jiaxin Bai, Yan Song +5

cs.CL2021

Importance-based Neuron Allocation for Multilingual Neural Machine Translation

Wanying Xie, Yang Feng, Shuhao Gu +1

cs.LG2019

A Unified Framework for Speech Separation

Fahimeh Bahmaninezhad, Shi-Xiong Zhang, Yong Xu +3

cs.CL2024

MM-LLMs: Recent Advances in MultiModal Large Language Models

Duzhen Zhang, Yahan Yu, Jiahua Dong +4

eess.AS2021

Audio-visual Multi-channel Integration and Recognition of Overlapped Speech

Jianwei Yu, Shi-Xiong Zhang, Bo Wu +6