cover song generation 1large language models 1music generation 1semantic tokenization 1text-to-music 1
From the 1 of 3 linked papers with an AI index.
3 papers
cs.SD2026
Qwen-Music Technical Report
Jin Xu, Kangdi Wang, Ruibin Yuan +24
Qwen-Music is a large language model‑based system that generates high‑fidelity songs with vocals from text prompts or re‑imagines existing tracks, using a semantic token representa…
cs.SD2026
DuoTok: Source-Aware Dual-Track Tokenization for Multi-Track Music Language Modeling
Rui Lin, Zhiyue Wu, Jiahe Le +4
Audio tokenization bridges continuous waveforms and multi-track music language models. In dual-track modeling, tokens should preserve three properties at once: high-fidelity recons…
cs.SD2025
Back to Ear: Perceptually Driven High Fidelity Music Reconstruction
Kangdi Wang, Zhiyue Wu, Dinghao Zhou +3
Variational Autoencoders (VAEs) are essential for large-scale audio tasks like diffusion-based generation. However, existing open-source models often neglect auditory perceptual as…