3 papers
cs.SD2026
Shao: Scaling Acoustic Token Language Models Toward High-Fidelity Music Generation
Jiafeng Liu, Yuanliang Dong, Hongjia Liu +8
A common design pattern in high-quality music generation is to handle structure and fidelity in different representation spaces: a generator first models high-level structure, foll…
cs.SD2026
Modeling Music as a Time-Frequency Image: A 2D Tokenizer for Music Generation
Yuqing Cheng, Xingyu Ma, Guochen Yu +1
Autoregressive music generation depends strongly on the audio tokenizer. Existing high-fidelity codecs often use residual multi-codebook quantization, which preserves reconstructio…
cs.SD2025
GLM-TTS Technical Report
Jiayan Cui, Zhihan Yang, Naihan Li +10
This work proposes GLM-TTS, a production-level TTS system designed for efficiency, controllability, and high-fidelity speech generation. GLM-TTS follows a two-stage architecture, c…