collaborators

5 papers

eess.AS2026

Neural Audio Codec with Adjustable Token Temporal Resolution Using Sampling-Frequency-Independent Convolutional Layers

Tomohiko Nakamura, Wataru Nakata, Kanami Imamura +1

Discrete tokens obtained from neural audio codecs (NACs) have been used as compact representations in audio generation and understanding models. In such token-based systems, token…

cs.SD2026

Dissecting Performance Degradation in Audio Source Separation under Sampling Frequency Mismatch

Kanami Imamura, Tomohiko Nakamura, Kohei Yatabe +1

Audio processing methods based on deep neural networks are typically trained at a single sampling frequency (SF). To handle untrained SFs, signal resampling is commonly employed, b…

cs.SD2025

Drum-to-Vocal Percussion Sound Conversion and Its Evaluation Methodology

Rinka Nobukawa, Makito Kitamura, Tomohiko Nakamura +2

This paper defines the novel task of drum-to-vocal percussion (VP) sound conversion. VP imitates percussion instruments through human vocalization and is frequently employed in con…

cs.SD2025

Multi-Sampling-Frequency Naturalness MOS Prediction Using Self-Supervised Learning Model with Sampling-Frequency-Independent Layer

Go Nishikawa, Wataru Nakata, Yuki Saito +3

We introduce our submission to the AudioMOS Challenge (AMC) 2025 Track 3: mean opinion score (MOS) prediction for speech with multiple sampling frequencies (SFs). Our submitted mod…

cs.SD2025

Hyperbolic Embeddings for Order-Aware Classification of Audio Effect Chains

Aogu Wada, Tomohiko Nakamura, Hiroshi Saruwatari

Audio effects (AFXs) are essential tools in music production, frequently applied in chains to shape timbre and dynamics. The order of AFXs in a chain plays a crucial role in determ…