306 citations
- University of CambridgeGB26 papers
- University of NottinghamGB21 papers
- FZU ‒ Institute of Physics of the Academy of Sciences of the Czech RepublicCZ18 papers
- Hitachi (Japan)JP9 papers
- Hitachi Global Storage Technologies (United States)US7 papers
- Johns Hopkins UniversityUS5 papers
- Texas A&M UniversityUS5 papers
- Chinese Academy of SciencesCN4 papers
- Czech Academy of Sciences, Institute of Plasma PhysicsCZ4 papers
- Institute of PhysicsPL4 papers
- Japan Science and Technology AgencyJP4 papers
- CEA GrenobleFR3 papers
9 papers · 1 filter
Semi-Supervised Training with Pseudo-Labeling for End-to-End Neural Diarization
Yuki Takashima, Yusuke Fujita, Shota Horiguchi +3
In this paper, we present a semi-supervised training technique using pseudo-labeling for end-to-end neural diarization (EEND). The EEND system has shown promising performance compa…
Flow-based Self-supervised Density Estimation for Anomalous Sound Detection
Kota Dohi, Takashi Endo, Harsh Purohit +2
To develop a machine sound monitoring system, a method for detecting anomalous sound is proposed. Exact likelihood estimation using Normalizing Flows is a promising technique for u…
Building Multi lingual TTS using Cross Lingual Voice Conversion
Qinghua Sun, Kenji Nagamatsu
In this paper we propose a new cross-lingual Voice Conversion (VC) approach which can generate all speech parameters (MCEP, LF0, BAP) from one DNN model using PPGs (Phonetic Poster…
Deep Autoencoding GMM-based Unsupervised Anomaly Detection in Acoustic Signals and its Hyper-parameter Optimization
Harsh Purohit, Ryo Tanabe, Takashi Endo +3
Failures or breakdowns in factory machinery can be costly to companies, so there is an increasing demand for automatic machine inspection. Existing approaches to acoustic signal-ba…
Utterance-Wise Meeting Transcription System Using Asynchronous Distributed Microphones
Shota Horiguchi, Yusuke Fujita, Kenji Nagamatsu
A novel framework for meeting transcription using asynchronous microphones is proposed in this paper. It consists of audio synchronization, speaker diarization, utterance-wise spee…
Sequence to Multi-Sequence Learning via Conditional Chain Mapping for Mixture Signals
Jing Shi, Xuankai Chang, Pengcheng Guo +5
Neural sequence-to-sequence models are well established for applications which can be cast as mapping a single input sequence into a single output sequence. In this work, we focus…