activity
20232026
most citedHQ-VAE: Hierarchical Discrete Representation Learning with Variational Bayes

1 citations · 1 across the 4 of their papers we have counts for

collaborators
Showing cs.SDShow all

10 papers · 1 filter

cs.SD2026

Iterative Audio Separation with Mixture Consistency via MIMO Model Extension

Yukara Ikemiya, WeiHsiang Liao, Yuki Mitsufuji

This paper proposes a general framework for stable and effective iterative audio separation with mixture consistency by extending source separation models to a multi-input multi-ou…

cs.SD2026

Break-the-Beat! Controllable MIDI-to-Drum Audio Synthesis

Shuyang Cui, Zhi Zhong, Qiyu Wu +9

Current methods for creating drum loop audio in digital music production, such as using one-shot samples or resampling, often demand non-trivial efforts of creators. While recent g…

cs.SD2025

Large-Scale Training Data Attribution for Music Generative Models via Unlearning

Woosung Choi, Junghyun Koo, Kin Wai Cheuk +7

This paper explores the use of unlearning methods for training data attribution (TDA) in music generative models trained on large-scale datasets. TDA aims to identify which specifi…

cs.SD20251 cited

CCStereo: Audio-Visual Contextual and Contrastive Learning for Binaural Audio Generation

Yuanhong Chen, Kazuki Shimada, Christian Simon +3

Binaural audio generation (BAG) aims to convert monaural audio to stereo audio using visual prompts, requiring a deep understanding of spatial and semantic information. However, cu…

cs.SD2024

Music Foundation Model as Generic Booster for Music Downstream Tasks

WeiHsiang Liao, Yuhta Takida, Yukara Ikemiya +13

We demonstrate the efficacy of using intermediate representations from a single foundation model to enhance various music downstream tasks. We introduce SoniDo, a music foundation…

cs.SD2024

Variable Bitrate Residual Vector Quantization for Audio Coding

Yunkee Chae, Woosung Choi, Yuhta Takida +8

Recent state-of-the-art neural audio compression models have progressively adopted residual vector quantization (RVQ). Despite this success, these models employ a fixed number of c…