3 papers
cs.SD2026
Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation
Xuanchen Li, Tianrui Wang, Yuheng Lu +11
Speech-to-text (S2T) systems for recognition (ASR) and translation (S2TT) typically generate discrete text tokens. In contrast, continuous-target language modelling performs genera…
cs.SD2026
Modeling Music as a Time-Frequency Image: A 2D Tokenizer for Music Generation
Yuqing Cheng, Xingyu Ma, Guochen Yu +1
Autoregressive music generation depends strongly on the audio tokenizer. Existing high-fidelity codecs often use residual multi-codebook quantization, which preserves reconstructio…
cs.SD2025
GLM-TTS Technical Report
Jiayan Cui, Zhihan Yang, Naihan Li +10
This work proposes GLM-TTS, a production-level TTS system designed for efficiency, controllability, and high-fidelity speech generation. GLM-TTS follows a two-stage architecture, c…