4 papers
DuoTok: Source-Aware Dual-Track Tokenization for Multi-Track Music Language Modeling
Rui Lin, Zhiyue Wu, Jiahe Le +4
Audio tokenization bridges continuous waveforms and multi-track music language models. In dual-track modeling, tokens should preserve three properties at once: high-fidelity recons…
Hear: Hierarchically Enhanced Aesthetic Representations For Multidimensional Music Evaluation
Shuyang Liu, Yuan Jin, Rui Lin +3
Evaluating song aesthetics is challenging due to the multidimensional nature of musical perception and the scarcity of labeled data. We propose HEAR, a robust music aesthetic evalu…
Back to Ear: Perceptually Driven High Fidelity Music Reconstruction
Kangdi Wang, Zhiyue Wu, Dinghao Zhou +3
Variational Autoencoders (VAEs) are essential for large-scale audio tasks like diffusion-based generation. However, existing open-source models often neglect auditory perceptual as…
Muyan-TTS: A Trainable Text-to-Speech Model Optimized for Podcast Scenarios with a $50K Budget
Xin Li, Kaikai Jia, Hao Sun +2
Recent advancements in text-to-speech (TTS) models have been driven by the integration of large language models (LLMs), enhancing semantic comprehension and improving speech natura…