4 papers
Do Music Foundation Models Embed Pitch in Helical Structure?
Hayato Yagi, Shinnosuke Takamichi, Rin Sato +2
This study analyzes the intermediate representations of music foundation models (MFMs) and reports the geometric structures used to represent pitch information. By inputting isolat…
Cross-lingual Data Selection Using Clip-level Acoustic Similarity for Enhancing Low-resource Automatic Speech Recognition
Shunsuke Mitsumori, Sara Kashiwagi, Keitaro Tanaka +1
This paper presents a novel donor data selection method to enhance low-resource automatic speech recognition (ASR). While ASR performs well in high-resource languages, its accuracy…
Formula-Supervised Sound Event Detection: Pre-Training Without Real Data
Yuto Shibata, Keitaro Tanaka, Yoshiaki Bando +3
In this paper, we propose a novel formula-driven supervised learning (FDSL) framework for pre-training an environmental sound analysis model by leveraging acoustic signals parametr…
SyncViolinist: Music-Oriented Violin Motion Generation Based on Bowing and Fingering
Hiroki Nishizawa, Keitaro Tanaka, Asuka Hirata +4
Automatically generating realistic musical performance motion can greatly enhance digital media production, often involving collaboration between professionals and musicians. Howev…