18 papers
nnAudio 2: Overcoming Dynamic Compilation Barriers and Transform Inconsistencies
Abhinaba Roy, Junyi Liang, Dorien Herremans
nnAudio is an open-source audio feature extraction toolbox for deep learning, but its use in current environments is hindered by TorchScript incompatibilities, inverse-transform ed…
APEX: Large-scale Multi-task Aesthetic-Informed Popularity Prediction for AI-Generated Music
Jaavid Aktar Husain, Dorien Herremans
Music popularity prediction has attracted growing research interest, with relevance to artists, platforms, and recommendation systems. However, the explosive rise of AI-generated m…
MERIT: Learning Disentangled Music Representations for Audio Similarity
Abhinaba Roy, Junyi Liang, Dorien Herremans
Current music similarity models typically compute a single, monolithic score, entangling distinct musical dimensions like melody, rhythm, and timbre. This limits user control and i…
Text2Score: Generating Sheet Music From Textual Prompts
Keshav Bhandari, Sungkyun Chang, Abhinaba Roy +4
Developing text-driven symbolic music generation models remains challenging due to the scarcity of aligned text-music datasets and the unreliability of automated captioning pipelin…
KARMA-MV: A Benchmark for Causal Question Answering on Music Videos
Archishman Ghosh, Abhinaba Roy, Dorien Herremans
While significant progress has been made in Video Question Answering and cross-modal understanding, causal reasoning about how visual dynamics drive musical structure in music vide…
When Drawing Is Not Enough: Exploring Spontaneous Speech with Sketch for Intent Alignment in Multimodal LLMs
Weiyan Shi, Dorien Herremans, Kenny Tsu Wei Choo
Early-stage design ideation often relies on rough sketches created under time pressure, leaving much of the designer's intent implicit. In practice, designers frequently speak whil…