2 papers
cs.SD2026
Shao: Scaling Acoustic Token Language Models Toward High-Fidelity Music Generation
Jiafeng Liu, Yuanliang Dong, Hongjia Liu +8
A common design pattern in high-quality music generation is to handle structure and fidelity in different representation spaces: a generator first models high-level structure, foll…
cs.SD2025
TISDiSS: A Training-Time and Inference-Time Scalable Framework for Discriminative Source Separation
Yongsheng Feng, Yuetonghui Xu, Jiehui Luo +4
Source separation is a fundamental task in speech, music, and audio processing, and it also provides cleaner and larger data for training generative models. However, improving sepa…