Publications (406)
Diffsound: Discrete Diffusion Model for Text-to-sound Generation
Dongchao Yang, Jianwei Yu, Helin Wang +4
U-Codec: Ultra Low Frame-rate Neural Speech Codec for Fast High-fidelity Speech Generation
Xusheng Yang, Long Zhou, Wenfu Wang +6
Bridging the Gap between Synthetic and Authentic Images for Multimodal Machine Translation
Wenyu Guo, Qingkai Fang, Dong Yu +1
Towards Robust Speaker Verification with Target Speaker Enhancement
Chunlei Zhang, Meng Yu, Chao Weng +1
Unifying Robustness and Fidelity: A Comprehensive Study of Pretrained Generative Methods for Speech Enhancement in Adverse Conditions
Heming Wang, Meng Yu, Hao Zhang +5
Robust Dialogue Utterance Rewriting as Sequence Tagging
Jie Hao, Linfeng Song, Liwei Wang +3
PitchNet: Unsupervised Singing Voice Conversion with Pitch Adversarial Network
Chengqi Deng, Chengzhu Yu, Heng Lu +2
OpenWebVoyager: Building Multimodal Web Agents via Iterative Real-World Exploration, Feedback and Optimization
Hongliang He, Wenlin Yao, Kaixin Ma +5
End-to-End Multi-Look Keyword Spotting
Meng Yu, Xuan Ji, Bo Wu +2
Gate-tunable superconducting quantum interference devices of PbS nanowires
Hong-Seok Kim, Bum-Kyu Kim, Yiming Yang +4
Exploring Stability-Plasticity Trade-offs for Continual Named Entity Recognition
Duzhen Zhang, Chenxing Li, Jiahua Dong +2
Don't Throw Away Your Pretrained Model
Shangbin Feng, Wenhao Yu, Yike Wang +3
Transferring Source Style in Non-Parallel Voice Conversion
Songxiang Liu, Yuewen Cao, Shiyin Kang +5
Automatic Summarization of Open-Domain Podcast Episodes
Kaiqiang Song, Chen Li, Xiaoyang Wang +2
WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models
Rui Wang, Ce Zhang, Jun-Yu Ma +10
Faithful Question Answering with Monte-Carlo Planning
Ruixin Hong, Hongming Zhang, Hong Zhao +2
Audio-visual Multi-channel Recognition of Overlapped Speech
Jianwei Yu, Bo Wu, Rongzhi Gu +7
Automatic Prosody Annotation with Pre-Trained Text-Speech Model
Ziqian Dai, Jianwei Yu, Yan Wang +5
Efficient Zero-shot Event Extraction with Context-Definition Alignment
Hongming Zhang, Wenlin Yao, Dong Yu
EconProver: Towards More Economical Test-Time Scaling for Automated Theorem Proving
Mukai Li, Linfeng Song, Zhenwen Liang +5
Improving Pre-Trained Multilingual Models with Vocabulary Expansion
Hai Wang, Dian Yu, Kai Sun +2
Covo-Audio Technical Report
Wenfu Wang, Chenxing Li, Liqiang Zhang +23
Attention Entropy is a Key Factor: An Analysis of Parallel Context Encoding with Full-attention-based Pre-trained Language Models
Zhisong Zhang, Yan Wang, Xinting Huang +5
NaturalConv: A Chinese Dialogue Dataset Towards Multi-turn Topic-driven Conversation
Xiaoyang Wang, Chen Li, Jianqiao Zhao +1
Time Domain Audio Visual Speech Separation
Jian Wu, Yong Xu, Shi-Xiong Zhang +4
UniGist: Towards General and Hardware-aligned Sequence-level Long Context Compression
Chenlong Deng, Zhisong Zhang, Kelong Mao +6
Hybrid AHS: A Hybrid of Kalman Filter and Deep Learning for Acoustic Howling Suppression
Hao Zhang, Meng Yu, Yuzhong Wu +2
Fabrication and Characterization of Superconducting Quantum Interference Device using (Bi_{1-x}Sb_x)_2Se_3 Topological Insulator Nanoribbons
Nam-Hee Kim, Hong-Seok Kim, Yiming Yang +3
Anomalous Fraunhofer patterns in CdAs Josephson Junctions
Rak-Hee Kim, Yeongmin Jang, Bob M. Wang +2
Improving Machine Reading Comprehension with General Reading Strategies
Kai Sun, Dian Yu, Dong Yu +1
Recognizing Multi-talker Speech with Permutation Invariant Training
Dong Yu, Xuankai Chang, Yanmin Qian
Permutation Invariant Training of Deep Models for Speaker-Independent Multi-talker Speech Separation
Dong Yu, Morten Kolbæk, Zheng-Hua Tan +1
Hierarchical Context Tagging for Utterance Rewriting
Lisa Jin, Linfeng Song, Lifeng Jin +2
MIMO Self-attentive RNN Beamformer for Multi-speaker Speech Separation
Xiyun Li, Yong Xu, Meng Yu +4
Nanosecond dynamics in intrinsic topological insulator revealed by time-resolved optical reflectivity
Adam L. Gross, Yasen Hou, Antonio Rossi +2
Scaling Synthetic Data Creation with 1,000,000,000 Personas
Tao Ge, Xin Chan, Xiaoyang Wang +3
Neural Network Augmented Kalman Filter for Robust Acoustic Howling Suppression
Yixuan Zhang, Hao Zhang, Meng Yu +1
Variable range hopping conduction in semiconductor nanocrystal solids
Dong Yu, Congjun Wang, Brian L. Wehrenberg +1
SemanticVocoder: Bridging Audio Generation and Audio Understanding via Semantic Latents
Zeyu Xie, Chenxing Li, Qiao Jin +6
Router-Tuning: A Simple and Effective Approach for Enabling Dynamic-Depth in Transformers
Shwai He, Tao Ge, Guoheng Sun +3
MetaLogic: Logical Reasoning Explanations with Fine-Grained Structure
Yinya Huang, Hongming Zhang, Ruixin Hong +3
Robust Disentangled Variational Speech Representation Learning for Zero-shot Voice Conversion
Jiachen Lian, Chunlei Zhang, Dong Yu
Feature Learning in Deep Neural Networks - Studies on Speech Recognition Tasks
Dong Yu, Michael L. Seltzer, Jinyu Li +2
Maximizing Mutual Information for Tacotron
Peng Liu, Xixin Wu, Shiyin Kang +3
Locas: Your Models are Principled Initializers of Locally-Supported Parametric Memories
Sidi Lu, Zhenwen Liang, Dongyang Ma +3
Advancing Multi-talker ASR Performance with Large Language Models
Mohan Shi, Zengrui Jin, Yaoxun Xu +6
Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation
Yongqi Wang, Chunlei Zhang, Hangting Chen +2
Integrating Lattice-Free MMI into End-to-End Speech Recognition
Jinchuan Tian, Jianwei Yu, Chao Weng +2
Very Strong Superconducting Proximity Effects in PbS Semiconductor Nanowires
Bum-Kyu Kim, Hong-Seok Kim, Yiming Yang +3
Verified Critical Step Optimization for LLM Agents
Mukai Li, Qingcheng Zeng, Tianqing Fang +5
Deep Learning for Joint Acoustic Echo and Acoustic Howling Suppression in Hybrid Meetings
Hao Zhang, Meng Yu, Dong Yu
From Continuous to Discrete: Cross-Domain Collaborative General Speech Enhancement via Hierarchical Language Models
Zhaoxi Mu, Rilin Chen, Andong Li +3
Modeling Fluency and Faithfulness for Diverse Neural Machine Translation
Yang Feng, Wanying Xie, Shuhao Gu +4
BDDM: Bilateral Denoising Diffusion Models for Fast and High-Quality Speech Synthesis
Max W. Y. Lam, Jun Wang, Dan Su +1
ParallelSpec: Parallel Drafter for Efficient Speculative Decoding
Zilin Xiao, Hongming Zhang, Tao Ge +3
Self-Teaching Machines to Read and Comprehend with Large-Scale Multi-Subject Question-Answering Data
Dian Yu, Kai Sun, Dong Yu +1
Dopamine Audiobook: A Training-free MLLM Agent for Emotional and Immersive Audiobook Generation
Yan Rong, Shan Yang, Chenxing Li +2
Video-to-Audio Generation with Hidden Alignment
Manjie Xu, Chenxing Li, Xinyi Tu +5
Improving LLM General Preference Alignment via Optimistic Online Mirror Descent
Yuheng Zhang, Dian Yu, Tao Ge +5
Evaluating Moral Beliefs across LLMs through a Pluralistic Framework
Xuelin Liu, Yanfei Zhu, Shucheng Zhu +3
Schottky Electric Field Induced Circular Photogalvanic Effect in Cd3As2 Nanobelts
Bob Minyu Wang, Yuqing Zhu, Henry Clark Travaglini +2
Improving Reverberant Speech Training Using Diffuse Acoustic Simulation
Zhenyu Tang, Lianwu Chen, Bo Wu +2
LAE: Language-Aware Encoder for Monolingual and Multilingual ASR
Jinchuan Tian, Jianwei Yu, Chunlei Zhang +3
Directional ASR: A New Paradigm for E2E Multi-Speaker Speech Recognition with Source Localization
Aswin Shanmugam Subramanian, Chao Weng, Shinji Watanabe +4
Spin Generation Via Bulk Spin Current in Three Dimensional Topological Insulators
Xingyue Peng, Yiming Yang, Rajiv R. P. Singh +2
Effective Low-Cost Time-Domain Audio Separation Using Globally Attentive Locally Recurrent Networks
Max W. Y. Lam, Jun Wang, Dan Su +1
Information-Theoretic Complementary Prompts for Improved Continual Text Classification
Duzhen Zhang, Yong Ren, Chenxing Li +2
InFoBench: Evaluating Instruction Following Ability in Large Language Models
Yiwei Qin, Kaiqiang Song, Yebowen Hu +7
Towards Solving More Challenging IMO Problems via Decoupled Reasoning and Proving
Zhenwen Liang, Linfeng Song, Yang Li +4
Joint Neural AEC and Beamforming with Double-Talk Detection
Vinay Kothapally, Yong Xu, Meng Yu +2
MetricNet: Towards Improved Modeling For Non-Intrusive Speech Quality Assessment
Meng Yu, Chunlei Zhang, Yong Xu +2
UNCLE: Benchmarking Uncertainty Expressions in Long-Form Generation
Ruihan Yang, Caiqi Zhang, Zhisong Zhang +4
VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining
Jianheng Zhuo, Yifan Yang, Yiwen Shao +4
LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory
Di Wu, Hongwei Wang, Wenhao Yu +3
End-to-End Multi-Channel Speech Separation
Rongzhi Gu, Jian Wu, Shi-Xiong Zhang +6
Tune-In: Training Under Negative Environments with Interference for Attention Networks Simulating Cocktail Party Effect
Jun Wang, Max W. Y. Lam, Dan Su +1
VCVTS: Multi-speaker Video-to-Speech synthesis via cross-modal knowledge transfer from voice conversion
Disong Wang, Shan Yang, Dan Su +3
Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards
Xiaoyuan Liu, Tian Liang, Zhiwei He +6
Latency-Controlled Neural Architecture Search for Streaming Speech Recognition
Liqiang He, Shulin Feng, Dan Su +1
Self-supervised Text-independent Speaker Verification using Prototypical Momentum Contrastive Learning
Wei Xia, Chunlei Zhang, Chao Weng +2
Do Gender Cues Affect LLM Value Trade-offs? Evidence from a Controlled Decision Benchmark
Yangyang Liu, Dong Yu, Pengyuan Liu
MART: Memory-Augmented Recurrent Transformer for Coherent Video Paragraph Captioning
Jie Lei, Liwei Wang, Yelong Shen +3
Connect-the-Dots: Bridging Semantics between Words and Definitions via Aligning Word Sense Inventories
Wenlin Yao, Xiaoman Pan, Lifeng Jin +3
MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning
Fuxiao Liu, Xiaoyang Wang, Wenlin Yao +5
SongPrep: A Preprocessing Framework and End-to-end Model for Full-song Structure Parsing and Lyrics Transcription
Wei Tan, Shun Lei, Huaicheng Zhang +6
Conceptual and Unbiased Reasoning in Language Models
Ben Zhou, Hongming Zhang, Sihao Chen +5
OpenCharacter: Training Customizable Role-Playing LLMs with Large-Scale Synthetic Personas
Xiaoyang Wang, Hongming Zhang, Tao Ge +3
Atomic Calibration of LLMs in Long-Form Generations
Caiqi Zhang, Ruihan Yang, Zhisong Zhang +4
TeCANet: Temporal-Contextual Attention Network for Environment-Aware Speech Dereverberation
Helin Wang, Bo Wu, Lianwu Chen +7
Teaching LLMs to Refine with Tools
Dian Yu, Yuheng Zhang, Jiahao Xu +5
Learn Beyond The Answer: Training Language Models with Reflection for Mathematical Reasoning
Zhihan Zhang, Tao Ge, Zhenwen Liang +5
RepoGraph: Enhancing AI Software Engineering with Repository-level Code Graph
Siru Ouyang, Wenhao Yu, Kaixin Ma +6
Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing
Ye Tian, Baolin Peng, Linfeng Song +4
Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification
Yuxuan Wan, Tianqing Fang, Zaitang Li +5
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
Junqi Zhao, Chenxing Li, Jinzheng Zhao +4
Multiplex Word Embeddings for Selectional Preference Acquisition
Hongming Zhang, Jiaxin Bai, Yan Song +5
Importance-based Neuron Allocation for Multilingual Neural Machine Translation
Wanying Xie, Yang Feng, Shuhao Gu +1
A Unified Framework for Speech Separation
Fahimeh Bahmaninezhad, Shi-Xiong Zhang, Yong Xu +3
MM-LLMs: Recent Advances in MultiModal Large Language Models
Duzhen Zhang, Yahan Yu, Jiahua Dong +4
Audio-visual Multi-channel Integration and Recognition of Overlapped Speech
Jianwei Yu, Shi-Xiong Zhang, Bo Wu +6