activity
20242026
collaborators

10 papers

cs.SD2026

nnAudio 2: Overcoming Dynamic Compilation Barriers and Transform Inconsistencies

Abhinaba Roy, Junyi Liang, Dorien Herremans

nnAudio is an open-source audio feature extraction toolbox for deep learning, but its use in current environments is hindered by TorchScript incompatibilities, inverse-transform ed…

cs.SD2026

MERIT: Learning Disentangled Music Representations for Audio Similarity

Abhinaba Roy, Junyi Liang, Dorien Herremans

Current music similarity models typically compute a single, monolithic score, entangling distinct musical dimensions like melody, rhythm, and timbre. This limits user control and i…

cs.SD2026

Text2Score: Generating Sheet Music From Textual Prompts

Keshav Bhandari, Sungkyun Chang, Abhinaba Roy +4

Developing text-driven symbolic music generation models remains challenging due to the scarcity of aligned text-music datasets and the unreliability of automated captioning pipelin…

cs.CV2026

KARMA-MV: A Benchmark for Causal Question Answering on Music Videos

Archishman Ghosh, Abhinaba Roy, Dorien Herremans

While significant progress has been made in Video Question Answering and cross-modal understanding, causal reasoning about how visual dynamics drive musical structure in music vide…

cs.SD2025

Aligning Generative Music AI with Human Preferences: Methods and Challenges

Dorien Herremans, Abhinaba Roy

Recent advances in generative AI for music have achieved remarkable fidelity and stylistic diversity, yet these systems often fail to align with nuanced human preferences due to th…

cs.SD2025

MelodySim: Measuring Melody-aware Music Similarity for Plagiarism Detection

Tongyu Lu, Charlotta-Marlena Geist, Jan Melechovsky +2

We propose MelodySim, a melody-aware music similarity model and dataset for plagiarism detection. First, we introduce a novel method to construct a dataset focused on melodic simil…