10 papers
nnAudio 2: Overcoming Dynamic Compilation Barriers and Transform Inconsistencies
Abhinaba Roy, Junyi Liang, Dorien Herremans
nnAudio is an open-source audio feature extraction toolbox for deep learning, but its use in current environments is hindered by TorchScript incompatibilities, inverse-transform ed…
MERIT: Learning Disentangled Music Representations for Audio Similarity
Abhinaba Roy, Junyi Liang, Dorien Herremans
Current music similarity models typically compute a single, monolithic score, entangling distinct musical dimensions like melody, rhythm, and timbre. This limits user control and i…
Text2Score: Generating Sheet Music From Textual Prompts
Keshav Bhandari, Sungkyun Chang, Abhinaba Roy +4
Developing text-driven symbolic music generation models remains challenging due to the scarcity of aligned text-music datasets and the unreliability of automated captioning pipelin…
KARMA-MV: A Benchmark for Causal Question Answering on Music Videos
Archishman Ghosh, Abhinaba Roy, Dorien Herremans
While significant progress has been made in Video Question Answering and cross-modal understanding, causal reasoning about how visual dynamics drive musical structure in music vide…
Aligning Generative Music AI with Human Preferences: Methods and Challenges
Dorien Herremans, Abhinaba Roy
Recent advances in generative AI for music have achieved remarkable fidelity and stylistic diversity, yet these systems often fail to align with nuanced human preferences due to th…
MelodySim: Measuring Melody-aware Music Similarity for Plagiarism Detection
Tongyu Lu, Charlotta-Marlena Geist, Jan Melechovsky +2
We propose MelodySim, a melody-aware music similarity model and dataset for plagiarism detection. First, we introduce a novel method to construct a dataset focused on melodic simil…