Publications (127)
2DP-2MRC: 2-Dimensional Pointer-based Machine Reading Comprehension Method for Multimodal Moment Retrieval
Jiajun He, Tomoki Toda
Voice Conversion Challenge 2020: Intra-lingual semi-parallel and cross-lingual voice conversion
Yi Zhao, Wen-Chin Huang, Xiaohai Tian +5
Attacking UTMOS: Probing the Robustness of a Speech Quality Assessment Model
Wen-Chin Huang, Tomoki Toda
Preference-based training framework for automatic speech quality assessment using deep neural network
Cheng-Hung Hu, Yusuke Yasuda, Tomoki Toda
Two-stage Framework for Robust Speech Emotion Recognition Using Target Speaker Extraction in Human Speech Noise Conditions
Jinyi Mi, Xiaohan Shi, Ding Ma +3
Intermediate Fine-Tuning Using Imperfect Synthetic Speech for Improving Electrolaryngeal Speech Recognition
Lester Phillip Violeta, Ding Ma, Wen-Chin Huang +1
A Comparative Study of Self-supervised Speech Representation Based Voice Conversion
Wen-Chin Huang, Shu-Wen Yang, Tomoki Hayashi +1
Quasi-Periodic Parallel WaveGAN: A Non-autoregressive Raw Waveform Generative Model with Pitch-dependent Dilated Convolution Neural Network
Yi-Chiao Wu, Tomoki Hayashi, Takuma Okamoto +2
A Spoofing Benchmark for the 2018 Voice Conversion Challenge: Leveraging from Spoofing Countermeasures for Speech Artifact Assessment
Tomi Kinnunen, Jaime Lorenzo-Trueba, Junichi Yamagishi +4
An Evaluation of Three-Stage Voice Conversion Framework for Noisy and Reverberant Conditions
Yeonjong Choi, Chao Xie, Tomoki Toda
Source-Filter HiFi-GAN: Fast and Pitch Controllable High-Fidelity Neural Vocoder
Reo Yoneyama, Yi-Chiao Wu, Tomoki Toda
Relationship between objective and subjective perceptual measures of speech in individuals with head and neck cancer
Bence Mark Halpern, Thomas Tienkamp, Teja Rebernik +4
Quasi-Periodic WaveNet: An Autoregressive Raw Waveform Generative Model with Pitch-dependent Dilated Convolution Neural Network
Yi-Chiao Wu, Tomoki Hayashi, Patrick Lumban Tobing +2
A Cyclical Post-filtering Approach to Mismatch Refinement of Neural Vocoder for Text-to-speech Systems
Yi-Chiao Wu, Patrick Lumban Tobing, Kazuki Yasuhara +3
MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction
Jiajun He, Xiaohan Shi, Xingfeng Li +1
The Voice Conversion Challenge 2018: Promoting Development of Parallel and Nonparallel Methods
Jaime Lorenzo-Trueba, Junichi Yamagishi, Tomoki Toda +4
Learning Emotion-discriminative Representations for Zero-Shot Cross-lingual Speech Emotion Recognition
Jinyi Mi, Ding Ma, Tomoki Toda
The NU Voice Conversion System for the Voice Conversion Challenge 2020: On the Effectiveness of Sequence-to-sequence Models and Autoregressive Neural Vocoders
Wen-Chin Huang, Patrick Lumban Tobing, Yi-Chiao Wu +2
MOS-Bench: Benchmarking Generalization Abilities of Subjective Speech Quality Assessment Models
Wen-Chin Huang, Erica Cooper, Tomoki Toda
High-Fidelity and Low-Latency Universal Neural Vocoder based on Multiband WaveRNN with Data-Driven Linear Prediction for Discrete Waveform Modeling
Patrick Lumban Tobing, Tomoki Toda
Discriminative Neighborhood Smoothing for Generative Anomalous Sound Detection
Takuya Fujimura, Keisuke Imoto, Tomoki Toda
Audio Difference Learning for Audio Captioning
Tatsuya Komatsu, Yusuke Fujita, Kazuya Takeda +1
An Extensive Analysis of the Singing Voice Conversion Challenge 2025 Evaluation Results
Lester Phillip Violeta, Xueyao Zhang, Jiatong Shi +4
The VoiceMOS Challenge 2024: Beyond Speech Quality Prediction
Wen-Chin Huang, Szu-Wei Fu, Erica Cooper +5
ASVspoof 2019: A large-scale public database of synthesized, converted and replayed speech
Xin Wang, Junichi Yamagishi, Massimiliano Todisco +37
SVDD Challenge 2024: A Singing Voice Deepfake Detection Challenge Evaluation Plan
You Zhang, Yongyi Zang, Jiatong Shi +5
The Sequence-to-Sequence Baseline for the Voice Conversion Challenge 2020: Cascading ASR and TTS
Wen-Chin Huang, Tomoki Hayashi, Shinji Watanabe +1
Eigenvoice Synthesis based on Model Editing for Speaker Generation
Masato Murata, Koichi Miyazaki, Tomoki Koriyama +1
Statistical Voice Conversion with Quasi-Periodic WaveNet Vocoder
Yi-Chiao Wu, Patrick Lumban Tobing, Tomoki Hayashi +2
Learning Separated Representations for Instrument-based Music Similarity
Yuka Hashizume, Li Li, Atsushi Miyashita +1
Serenade: A Singing Style Conversion Framework Based On Audio Infilling
Lester Phillip Violeta, Wen-Chin Huang, Tomoki Toda
A new cosine series antialiasing function and its application to aliasing-free glottal source models for speech and singing synthesis
Hideki Kawahara, Ken-Ichi Sakakibara, Hideki Banno +3
SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit
Wen-Chin Huang, Erica Cooper, Tomoki Toda
Non-autoregressive sequence-to-sequence voice conversion
Tomoki Hayashi, Wen-Chin Huang, Kazuhiro Kobayashi +1
CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection
Yongyi Zang, Jiatong Shi, You Zhang +8
The VoiceMOS Challenge 2023: Zero-shot Subjective Speech Quality Prediction for Multiple Domains
Erica Cooper, Wen-Chin Huang, Yu Tsao +3
Back-Translation-Style Data Augmentation for End-to-End ASR
Tomoki Hayashi, Shinji Watanabe, Yu Zhang +4
A Comparative Study of Voice Conversion Models with Large-Scale Speech and Singing Data: The T13 Systems for the Singing Voice Conversion Challenge 2023
Ryuichi Yamamoto, Reo Yoneyama, Lester Phillip Violeta +2
Investigation of F0 conditioning and Fully Convolutional Networks in Variational Autoencoder based Voice Conversion
Wen-Chin Huang, Yi-Chiao Wu, Chen-Chou Lo +6
Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments
Reo Yoneyama, Masaya Kawamura, Ryo Terashima +2
GIA-MIC: Multimodal Emotion Recognition with Gated Interactive Attention and Modality-Invariant Learning Constraints
Jiajun He, Jinyi Mi, Tomoki Toda
A Comprehensive Study on the Effectiveness of ASR Representations for Noise-Robust Speech Emotion Recognition
Xiaohan Shi, Jiajun He, Xingfeng Li +1
Noisy-to-Noisy Voice Conversion Framework with Denoising Model
Chao Xie, Yi-Chiao Wu, Patrick Lumban Tobing +2
Frequency domain variants of velvet noise and their application to speech processing and synthesis: with appendices
Hideki Kawahara, Ken-Ichi Sakakibara, Masanori Morise +3
Handling Domain Shifts for Anomalous Sound Detection: A Review of DCASE-Related Work
Kevin Wilkinghoff, Takuya Fujimura, Keisuke Imoto +3
PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding
Jiajun He, Tomoki Toda
Evaluating Methods for Ground-Truth-Free Foreign Accent Conversion
Wen-Chin Huang, Tomoki Toda
Unified Source-Filter GAN: Unified Source-filter Network Based On Factorization of Quasi-Periodic Parallel WaveGAN
Reo Yoneyama, Yi-Chiao Wu, Tomoki Toda
Reference-free automatic speech severity evaluation using acoustic unit language modelling
Bence Mark Halpern, Tomoki Toda
On Prosody Modeling for ASR+TTS based Voice Conversion
Wen-Chin Huang, Tomoki Hayashi, Xinjian Li +2
Wavehax: Aliasing-Free Neural Waveform Synthesis Based on 2D Convolution and Harmonic Prior for Reliable Complex Spectrogram Estimation
Reo Yoneyama, Atsushi Miyashita, Ryuichi Yamamoto +1
Multi-speaker Text-to-speech Training with Speaker Anonymized Data
Wen-Chin Huang, Yi-Chiao Wu, Tomoki Toda
The AS-NU System for the M2VoC Challenge
Cheng-Hung Hu, Yi-Chiao Wu, Wen-Chin Huang +6
Predictions of Subjective Ratings and Spoofing Assessments of Voice Conversion Challenge 2020 Submissions
Rohan Kumar Das, Tomi Kinnunen, Wen-Chin Huang +5
Analysis and Extension of Noisy-target Training for Unsupervised Target Signal Enhancement
Takuya Fujimura, Tomoki Toda
Speaker Privacy and Security in the Big Data Era: Protection and Defense against Deepfake
Liping Chen, Kong Aik Lee, Zhen-Hua Ling +4
Multi-Head Decoder for End-to-End Speech Recognition
Tomoki Hayashi, Shinji Watanabe, Tomoki Toda +1
The VoiceMOS Challenge 2022
Wen-Chin Huang, Erica Cooper, Yu Tsao +3
Improving severity preservation of healthy-to-pathological voice conversion with global style tokens
Bence Mark Halpern, Wen-Chin Huang, Lester Phillip Violeta +2
Unified Source-Filter GAN with Harmonic-plus-Noise Source Excitation Generation
Reo Yoneyama, Yi-Chiao Wu, Tomoki Toda
crank: An Open-Source Software for Nonparallel Voice Conversion Based on Vector-Quantized Variational Autoencoder
Kazuhiro Kobayashi, Wen-Chin Huang, Yi-Chiao Wu +3
Speech Recognition by Simply Fine-tuning BERT
Wen-Chin Huang, Chia-Hua Wu, Shang-Bao Luo +3
Quasi-Periodic Parallel WaveGAN Vocoder: A Non-autoregressive Pitch-dependent Dilated Convolution Model for Parametric Speech Generation
Yi-Chiao Wu, Tomoki Hayashi, Takuma Okamoto +2
AAS-VC: On the Generalization Ability of Automatic Alignment Search based Non-autoregressive Sequence-to-sequence Voice Conversion
Wen-Chin Huang, Kazuhiro Kobayashi, Tomoki Toda
PathBench: Speech Intelligibility Benchmark for Automatic Pathological Speech Assessment
Bence Mark Halpern, Thomas Tienkamp, Defne Abur +1
Towards Identity Preserving Normal to Dysarthric Voice Conversion
Wen-Chin Huang, Bence Mark Halpern, Lester Phillip Violeta +2
LDNet: Unified Listener Dependent Modeling in MOS Prediction for Synthetic Speech
Wen-Chin Huang, Erica Cooper, Junichi Yamagishi +1
Learning Multidimensional Disentangled Representations of Instrumental Sounds for Musical Similarity Assessment
Yuka Hashizume, Li Li, Atsushi Miyashita +1
Improving Anomalous Sound Detection through Pseudo-anomalous Set Selection and Pseudo-label Utilization under Unlabeled Conditions
Ibuki Kuroyanagi, Takuya Fujimura, Kazuya Takeda +1
Text-to-speech synthesis based on latent variable conversion using diffusion probabilistic model and variational autoencoder
Yusuke Yasuda, Tomoki Toda
Generalization of Spectrum Differential based Direct Waveform Modification for Voice Conversion
Wen-Chin Huang, Yi-Chiao Wu, Kazuhiro Kobayashi +6
Any-to-One Sequence-to-Sequence Voice Conversion using Self-Supervised Discrete Speech Representations
Wen-Chin Huang, Yi-Chiao Wu, Tomoki Hayashi +1
Pseudo-label distillation for discriminative anomalous sound detection
Takuya Fujimura, Tomoki Toda
The AudioMOS Challenge 2025
Wen-Chin Huang, Hui Wang, Cheng Liu +6
The Singing Voice Conversion Challenge 2023
Wen-Chin Huang, Lester Phillip Violeta, Songxiang Liu +2
Refined WaveNet Vocoder for Variational Autoencoder Based Voice Conversion
Wen-Chin Huang, Yi-Chiao Wu, Hsin-Te Hwang +6
HASA-net: A non-intrusive hearing-aid speech assessment network
Hsin-Tien Chiang, Yi-Chiao Wu, Cheng Yu +4
A Preliminary Study of a Two-Stage Paradigm for Preserving Speaker Identity in Dysarthric Voice Conversion
Wen-Chin Huang, Kazuhiro Kobayashi, Yu-Huai Peng +4
SVDD 2024: The Inaugural Singing Voice Deepfake Detection Challenge
You Zhang, Yongyi Zang, Jiatong Shi +3
Direct Noisy Speech Modeling for Noisy-to-Noisy Voice Conversion
Chao Xie, Yi-Chiao Wu, Patrick Lumban Tobing +2
Relational Data Selection for Data Augmentation of Speaker-dependent Multi-band MelGAN Vocoder
Yi-Chiao Wu, Cheng-Hung Hu, Hung-Shin Lee +5
Quantifying the effect of speech pathology on automatic and human speaker verification
Bence Mark Halpern, Thomas Tienkamp, Wen-Chin Huang +7
Investigation of perceptual music similarity focusing on each instrumental part
Yuka Hashizume, Tomoki Toda
Quasi-Periodic WaveNet Vocoder: A Pitch Dependent Dilated Convolution Model for Parametric Speech Generation
Yi-Chiao Wu, Tomoki Hayashi, Patrick Lumban Tobing +2
Low-Latency Real-Time Non-Parallel Voice Conversion based on Cyclic Variational Autoencoder and Multiband WaveRNN with Data-Driven Linear Prediction
Patrick Lumban Tobing, Tomoki Toda
Generalized Multichannel Variational Autoencoder for Underdetermined Source Separation
Shogo Seki, Hirokazu Kameoka, Li Li +2
Improvements of Discriminative Feature Space Training for Anomalous Sound Detection in Unlabeled Conditions
Takuya Fujimura, Ibuki Kuroyanagi, Tomoki Toda
PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation
Jiajun He, Naoki Sawada, Koichi Miyazaki +1
A Cyclical Approach to Synthetic and Natural Speech Mismatch Refinement of Neural Post-filter for Low-cost Text-to-speech System
Yi-Chiao Wu, Patrick Lumban Tobing, Kazuki Yasuhara +3
Music Similarity Calculation of Individual Instrumental Sounds Using Metric Learning
Yuka Hashizume, Li Li, Tomoki Toda
An Analysis of Personalized Speech Recognition System Development for the Deaf and Hard-of-Hearing
Lester Phillip Violeta, Tomoki Toda
Non-Parallel Voice Conversion with Cyclic Variational Autoencoder
Patrick Lumban Tobing, Yi-Chiao Wu, Tomoki Hayashi +2
Collapsed speech segment detection and suppression for WaveNet vocoder
Yi-Chiao Wu, Kazuhiro Kobayashi, Tomoki Hayashi +2
XPPG-PCA: Reference-free automatic speech severity evaluation with principal components
Bence Mark Halpern, Thomas B. Tienkamp, Teja Rebernik +5
Unifying Listener Scoring Scales: Comparison Learning Framework for Speech Quality Assessment and Continuous Speech Emotion Recognition
Cheng-Hung Hu, Yusuke Yasuda, Akifumi Yoshimoto +1
Analysis of Noisy-target Training for DNN-based speech enhancement
Takuya Fujimura, Tomoki Toda
NNSVS: A Neural Network-Based Singing Voice Synthesis Toolkit
Ryuichi Yamamoto, Reo Yoneyama, Tomoki Toda
Many-to-Many Voice Transformer Network
Hirokazu Kameoka, Wen-Chin Huang, Kou Tanaka +3
ESPnet-TTS: Unified, Reproducible, and Integratable Open Source End-to-End Text-to-Speech Toolkit
Tomoki Hayashi, Ryuichi Yamamoto, Katsuki Inoue +6
A modulation property of time-frequency derivatives of filtered phase and its application to aperiodicity and fo estimation
Hideki Kawahara, Ken-Ichi Sakakibara, Masanori Morise +2