collaborators

5 papers

cs.SD2025

DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds

Takuya Hasumi, Yusuke Fujita

We propose a new dataset for cinematic audio source separation (CASS) that handles non-verbal sounds. Existing CASS datasets only contain reading-style sounds as a speech stem. The…

cs.SD2025

Music Tagging with Classifier Group Chains

Takuya Hasumi, Tatsuya Komatsu, Yusuke Fujita

We propose music tagging with classifier chains that model the interplay of music tags. Most conventional methods estimate multiple tags independently by treating them as multiple…

eess.AS2024

Song Data Cleansing for End-to-End Neural Singer Diarization Using Neural Analysis and Synthesis Framework

Hokuto Munakata, Ryo Terashima, Yusuke Fujita

We propose a data cleansing method that utilizes a neural analysis and synthesis (NANSY++) framework to train an end-to-end neural diarization model (EEND) for singer diarization.…

eess.AS2024

Audio Fingerprinting with Holographic Reduced Representations

Yusuke Fujita, Tatsuya Komatsu

This paper proposes an audio fingerprinting model with holographic reduced representation (HRR). The proposed method reduces the number of stored fingerprints, whereas conventional…

eess.AS2024

Universal Score-based Speech Enhancement with High Content Preservation

Robin Scheibler, Yusuke Fujita, Yuma Shirahata +1

We propose UNIVERSE++, a universal speech enhancement method based on score-based diffusion and adversarial training. Specifically, we improve the existing UNIVERSE model that deco…