activity
20222024
most citedConceptBeam: Concept Driven Target Speech Extraction

17 citations · 18 across the 6 of their papers we have counts for

collaborators

6 papers

eess.AS2024

Exploring Pre-trained General-purpose Audio Representations for Heart Murmur Detection

Daisuke Niizumi, Daiki Takeuchi, Yasunori Ohishi +2

To reduce the need for skilled clinicians in heart sound interpretation, recent studies on automating cardiac auscultation have explored deep learning approaches. However, despite…

eess.AS2024

Masked Modeling Duo: Towards a Universal Audio Pre-training Framework

Daisuke Niizumi, Daiki Takeuchi, Yasunori Ohishi +2

Self-supervised learning (SSL) using masked prediction has made great strides in general-purpose audio representation. This study proposes Masked Modeling Duo (M2D), an improved ma…

cs.CV2023

Deep Attentive Time Warping

Shinnosuke Matsuo, Xiaomeng Wu, Gantugs Atarsaikhan +4

Similarity measures for time series are important problems for time series classification. To handle the nonlinear time distortions, Dynamic Time Warping (DTW) has been widely used…

eess.AS20231 cited

Audio Difference Captioning Utilizing Similarity-Discrepancy Disentanglement

Daiki Takeuchi, Yasunori Ohishi, Daisuke Niizumi +2

We proposed Audio Difference Captioning (ADC) as a new extension task of audio captioning for describing the semantic differences between input pairs of similar but slightly differ…

eess.AS202217 cited

ConceptBeam: Concept Driven Target Speech Extraction

Yasunori Ohishi, Marc Delcroix, Tsubasa Ochiai +6

We propose a novel framework for target speech extraction based on semantic information, called ConceptBeam. Target speech extraction means extracting the speech of a target speake…

eess.AS2022

Introducing Auxiliary Text Query-modifier to Content-based Audio Retrieval

Daiki Takeuchi, Yasunori Ohishi, Daisuke Niizumi +2

The amount of audio data available on public websites is growing rapidly, and an efficient mechanism for accessing the desired data is necessary. We propose a content-based audio r…