NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (127)

cs.CV2024

2DP-2MRC: 2-Dimensional Pointer-based Machine Reading Comprehension Method for Multimodal Moment Retrieval

Jiajun He, Tomoki Toda

eess.AS2020

Voice Conversion Challenge 2020: Intra-lingual semi-parallel and cross-lingual voice conversion

Yi Zhao, Wen-Chin Huang, Xiaohai Tian +5

cs.SD2026

Attacking UTMOS: Probing the Robustness of a Speech Quality Assessment Model

Wen-Chin Huang, Tomoki Toda

eess.AS2023

Preference-based training framework for automatic speech quality assessment using deep neural network

Cheng-Hung Hu, Yusuke Yasuda, Tomoki Toda

cs.SD2024

Two-stage Framework for Robust Speech Emotion Recognition Using Target Speaker Extraction in Human Speech Noise Conditions

Jinyi Mi, Xiaohan Shi, Ding Ma +3

cs.SD2023

Intermediate Fine-Tuning Using Imperfect Synthetic Speech for Improving Electrolaryngeal Speech Recognition

Lester Phillip Violeta, Ding Ma, Wen-Chin Huang +1

cs.SD2022

A Comparative Study of Self-supervised Speech Representation Based Voice Conversion

Wen-Chin Huang, Shu-Wen Yang, Tomoki Hayashi +1

eess.AS2021

Quasi-Periodic Parallel WaveGAN: A Non-autoregressive Raw Waveform Generative Model with Pitch-dependent Dilated Convolution Neural Network

Yi-Chiao Wu, Tomoki Hayashi, Takuma Okamoto +2

eess.AS2018

A Spoofing Benchmark for the 2018 Voice Conversion Challenge: Leveraging from Spoofing Countermeasures for Speech Artifact Assessment

Tomi Kinnunen, Jaime Lorenzo-Trueba, Junichi Yamagishi +4

cs.SD2022

An Evaluation of Three-Stage Voice Conversion Framework for Noisy and Reverberant Conditions

Yeonjong Choi, Chao Xie, Tomoki Toda

cs.SD2023

Source-Filter HiFi-GAN: Fast and Pitch Controllable High-Fidelity Neural Vocoder

Reo Yoneyama, Yi-Chiao Wu, Tomoki Toda

cs.SD2025

Relationship between objective and subjective perceptual measures of speech in individuals with head and neck cancer

Bence Mark Halpern, Thomas Tienkamp, Teja Rebernik +4

eess.AS2021

Quasi-Periodic WaveNet: An Autoregressive Raw Waveform Generative Model with Pitch-dependent Dilated Convolution Neural Network

Yi-Chiao Wu, Tomoki Hayashi, Patrick Lumban Tobing +2

eess.AS2020

A Cyclical Post-filtering Approach to Mismatch Refinement of Neural Vocoder for Text-to-speech Systems

Yi-Chiao Wu, Patrick Lumban Tobing, Kazuki Yasuhara +3

cs.CL2024

MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction

Jiajun He, Xiaohan Shi, Xingfeng Li +1

eess.AS2018

The Voice Conversion Challenge 2018: Promoting Development of Parallel and Nonparallel Methods

Jaime Lorenzo-Trueba, Junichi Yamagishi, Tomoki Toda +4

cs.SD2026

Learning Emotion-discriminative Representations for Zero-Shot Cross-lingual Speech Emotion Recognition

Jinyi Mi, Ding Ma, Tomoki Toda

eess.AS2020

The NU Voice Conversion System for the Voice Conversion Challenge 2020: On the Effectiveness of Sequence-to-sequence Models and Autoregressive Neural Vocoders

Wen-Chin Huang, Patrick Lumban Tobing, Yi-Chiao Wu +2

cs.SD2026

MOS-Bench: Benchmarking Generalization Abilities of Subjective Speech Quality Assessment Models

Wen-Chin Huang, Erica Cooper, Tomoki Toda

cs.SD2021

High-Fidelity and Low-Latency Universal Neural Vocoder based on Multiband WaveRNN with Data-Driven Linear Prediction for Discrete Waveform Modeling

Patrick Lumban Tobing, Tomoki Toda

eess.AS2024

Discriminative Neighborhood Smoothing for Generative Anomalous Sound Detection

Takuya Fujimura, Keisuke Imoto, Tomoki Toda

eess.AS2023

Audio Difference Learning for Audio Captioning

Tatsuya Komatsu, Yusuke Fujita, Kazuya Takeda +1

cs.SD2026

An Extensive Analysis of the Singing Voice Conversion Challenge 2025 Evaluation Results

Lester Phillip Violeta, Xueyao Zhang, Jiatong Shi +4

cs.SD2024

The VoiceMOS Challenge 2024: Beyond Speech Quality Prediction

Wen-Chin Huang, Szu-Wei Fu, Erica Cooper +5

eess.AS2020

ASVspoof 2019: A large-scale public database of synthesized, converted and replayed speech

Xin Wang, Junichi Yamagishi, Massimiliano Todisco +37

eess.AS2024

SVDD Challenge 2024: A Singing Voice Deepfake Detection Challenge Evaluation Plan

You Zhang, Yongyi Zang, Jiatong Shi +5

eess.AS2020

The Sequence-to-Sequence Baseline for the Voice Conversion Challenge 2020: Cascading ASR and TTS

Wen-Chin Huang, Tomoki Hayashi, Shinji Watanabe +1

cs.SD2025

Eigenvoice Synthesis based on Model Editing for Speaker Generation

Masato Murata, Koichi Miyazaki, Tomoki Koriyama +1

eess.AS2020

Statistical Voice Conversion with Quasi-Periodic WaveNet Vocoder

Yi-Chiao Wu, Patrick Lumban Tobing, Tomoki Hayashi +2

cs.SD2025

Learning Separated Representations for Instrument-based Music Similarity

Yuka Hashizume, Li Li, Atsushi Miyashita +1

cs.SD2025

Serenade: A Singing Style Conversion Framework Based On Audio Infilling

Lester Phillip Violeta, Wen-Chin Huang, Tomoki Toda

eess.AS2017

A new cosine series antialiasing function and its application to aliasing-free glottal source models for speech and singing synthesis

Hideki Kawahara, Ken-Ichi Sakakibara, Hideki Banno +3

cs.SD2025

SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit

Wen-Chin Huang, Erica Cooper, Tomoki Toda

cs.SD2021

Non-autoregressive sequence-to-sequence voice conversion

Tomoki Hayashi, Wen-Chin Huang, Kazuhiro Kobayashi +1

eess.AS2024

CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection

Yongyi Zang, Jiatong Shi, You Zhang +8

eess.AS2023

The VoiceMOS Challenge 2023: Zero-shot Subjective Speech Quality Prediction for Multiple Domains

Erica Cooper, Wen-Chin Huang, Yu Tsao +3

cs.CL2018

Back-Translation-Style Data Augmentation for End-to-End ASR

Tomoki Hayashi, Shinji Watanabe, Yu Zhang +4

eess.AS2023

A Comparative Study of Voice Conversion Models with Large-Scale Speech and Singing Data: The T13 Systems for the Singing Voice Conversion Challenge 2023

Ryuichi Yamamoto, Reo Yoneyama, Lester Phillip Violeta +2

eess.AS2019

Investigation of F0 conditioning and Fully Convolutional Networks in Variational Autoencoder based Voice Conversion

Wen-Chin Huang, Yi-Chiao Wu, Chen-Chou Lo +6

cs.SD2025

Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments

Reo Yoneyama, Masaya Kawamura, Ryo Terashima +2

cs.AI2025

GIA-MIC: Multimodal Emotion Recognition with Gated Interactive Attention and Modality-Invariant Learning Constraints

Jiajun He, Jinyi Mi, Tomoki Toda

cs.SD2026

A Comprehensive Study on the Effectiveness of ASR Representations for Noise-Robust Speech Emotion Recognition

Xiaohan Shi, Jiajun He, Xingfeng Li +1

cs.SD2021

Noisy-to-Noisy Voice Conversion Framework with Denoising Model

Chao Xie, Yi-Chiao Wu, Patrick Lumban Tobing +2

cs.SD2018

Frequency domain variants of velvet noise and their application to speech processing and synthesis: with appendices

Hideki Kawahara, Ken-Ichi Sakakibara, Masanori Morise +3

eess.AS2025

Handling Domain Shifts for Anomalous Sound Detection: A Review of DCASE-Related Work

Kevin Wilkinghoff, Takuya Fujimura, Keisuke Imoto +3

eess.AS2025

PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding

Jiajun He, Tomoki Toda

cs.SD2023

Evaluating Methods for Ground-Truth-Free Foreign Accent Conversion

Wen-Chin Huang, Tomoki Toda

cs.SD2021

Unified Source-Filter GAN: Unified Source-filter Network Based On Factorization of Quasi-Periodic Parallel WaveGAN

Reo Yoneyama, Yi-Chiao Wu, Tomoki Toda

cs.SD2025

Reference-free automatic speech severity evaluation using acoustic unit language modelling

Bence Mark Halpern, Tomoki Toda

cs.SD2021

On Prosody Modeling for ASR+TTS based Voice Conversion

Wen-Chin Huang, Tomoki Hayashi, Xinjian Li +2

cs.SD2025

Wavehax: Aliasing-Free Neural Waveform Synthesis Based on 2D Convolution and Harmonic Prior for Reliable Complex Spectrogram Estimation

Reo Yoneyama, Atsushi Miyashita, Ryuichi Yamamoto +1

eess.AS2024

Multi-speaker Text-to-speech Training with Speaker Anonymized Data

Wen-Chin Huang, Yi-Chiao Wu, Tomoki Toda

eess.AS2021

The AS-NU System for the M2VoC Challenge

Cheng-Hung Hu, Yi-Chiao Wu, Wen-Chin Huang +6

eess.AS2020

Predictions of Subjective Ratings and Spoofing Assessments of Voice Conversion Challenge 2020 Submissions

Rohan Kumar Das, Tomi Kinnunen, Wen-Chin Huang +5

eess.AS2025

Analysis and Extension of Noisy-target Training for Unsupervised Target Signal Enhancement

Takuya Fujimura, Tomoki Toda

eess.AS2025

Speaker Privacy and Security in the Big Data Era: Protection and Defense against Deepfake

Liping Chen, Kong Aik Lee, Zhen-Hua Ling +4

cs.CL2018

Multi-Head Decoder for End-to-End Speech Recognition

Tomoki Hayashi, Shinji Watanabe, Tomoki Toda +1

cs.SD2022

The VoiceMOS Challenge 2022

Wen-Chin Huang, Erica Cooper, Yu Tsao +3

cs.SD2023

Improving severity preservation of healthy-to-pathological voice conversion with global style tokens

Bence Mark Halpern, Wen-Chin Huang, Lester Phillip Violeta +2

cs.SD2022

Unified Source-Filter GAN with Harmonic-plus-Noise Source Excitation Generation

Reo Yoneyama, Yi-Chiao Wu, Tomoki Toda

eess.AS2021

crank: An Open-Source Software for Nonparallel Voice Conversion Based on Vector-Quantized Variational Autoencoder

Kazuhiro Kobayashi, Wen-Chin Huang, Yi-Chiao Wu +3

cs.SD2021

Speech Recognition by Simply Fine-tuning BERT

Wen-Chin Huang, Chia-Hua Wu, Shang-Bao Luo +3

eess.AS2020

Quasi-Periodic Parallel WaveGAN Vocoder: A Non-autoregressive Pitch-dependent Dilated Convolution Model for Parametric Speech Generation

Yi-Chiao Wu, Tomoki Hayashi, Takuma Okamoto +2

cs.SD2023

AAS-VC: On the Generalization Ability of Automatic Alignment Search based Non-autoregressive Sequence-to-sequence Voice Conversion

Wen-Chin Huang, Kazuhiro Kobayashi, Tomoki Toda

cs.SD2026

PathBench: Speech Intelligibility Benchmark for Automatic Pathological Speech Assessment

Bence Mark Halpern, Thomas Tienkamp, Defne Abur +1

cs.SD2021

Towards Identity Preserving Normal to Dysarthric Voice Conversion

Wen-Chin Huang, Bence Mark Halpern, Lester Phillip Violeta +2

cs.SD2021

LDNet: Unified Listener Dependent Modeling in MOS Prediction for Synthetic Speech

Wen-Chin Huang, Erica Cooper, Junichi Yamagishi +1

cs.SD2024

Learning Multidimensional Disentangled Representations of Instrumental Sounds for Musical Similarity Assessment

Yuka Hashizume, Li Li, Atsushi Miyashita +1

cs.SD2025

Improving Anomalous Sound Detection through Pseudo-anomalous Set Selection and Pseudo-label Utilization under Unlabeled Conditions

Ibuki Kuroyanagi, Takuya Fujimura, Kazuya Takeda +1

eess.AS2022

Text-to-speech synthesis based on latent variable conversion using diffusion probabilistic model and variational autoencoder

Yusuke Yasuda, Tomoki Toda

eess.AS2019

Generalization of Spectrum Differential based Direct Waveform Modification for Voice Conversion

Wen-Chin Huang, Yi-Chiao Wu, Kazuhiro Kobayashi +6

eess.AS2020

Any-to-One Sequence-to-Sequence Voice Conversion using Self-Supervised Discrete Speech Representations

Wen-Chin Huang, Yi-Chiao Wu, Tomoki Hayashi +1

eess.AS2026

Pseudo-label distillation for discriminative anomalous sound detection

Takuya Fujimura, Tomoki Toda

cs.SD2025

The AudioMOS Challenge 2025

Wen-Chin Huang, Hui Wang, Cheng Liu +6

cs.SD2023

The Singing Voice Conversion Challenge 2023

Wen-Chin Huang, Lester Phillip Violeta, Songxiang Liu +2

eess.AS2019

Refined WaveNet Vocoder for Variational Autoencoder Based Voice Conversion

Wen-Chin Huang, Yi-Chiao Wu, Hsin-Te Hwang +6

eess.AS2021

HASA-net: A non-intrusive hearing-aid speech assessment network

Hsin-Tien Chiang, Yi-Chiao Wu, Cheng Yu +4

cs.SD2021

A Preliminary Study of a Two-Stage Paradigm for Preserving Speaker Identity in Dysarthric Voice Conversion

Wen-Chin Huang, Kazuhiro Kobayashi, Yu-Huai Peng +4

eess.AS2024

SVDD 2024: The Inaugural Singing Voice Deepfake Detection Challenge

You Zhang, Yongyi Zang, Jiatong Shi +3

cs.SD2021

Direct Noisy Speech Modeling for Noisy-to-Noisy Voice Conversion

Chao Xie, Yi-Chiao Wu, Patrick Lumban Tobing +2

eess.AS2021

Relational Data Selection for Data Augmentation of Speaker-dependent Multi-band MelGAN Vocoder

Yi-Chiao Wu, Cheng-Hung Hu, Hung-Shin Lee +5

cs.SD2024

Quantifying the effect of speech pathology on automatic and human speaker verification

Bence Mark Halpern, Thomas Tienkamp, Wen-Chin Huang +7

cs.SD2025

Investigation of perceptual music similarity focusing on each instrumental part

Yuka Hashizume, Tomoki Toda

eess.AS2020

Quasi-Periodic WaveNet Vocoder: A Pitch Dependent Dilated Convolution Model for Parametric Speech Generation

Yi-Chiao Wu, Tomoki Hayashi, Patrick Lumban Tobing +2

cs.SD2021

Low-Latency Real-Time Non-Parallel Voice Conversion based on Cyclic Variational Autoencoder and Multiband WaveRNN with Data-Driven Linear Prediction

Patrick Lumban Tobing, Tomoki Toda

stat.ML2018

Generalized Multichannel Variational Autoencoder for Underdetermined Source Separation

Shogo Seki, Hirokazu Kameoka, Li Li +2

eess.AS2024

Improvements of Discriminative Feature Space Training for Anomalous Sound Detection in Unlabeled Conditions

Takuya Fujimura, Ibuki Kuroyanagi, Tomoki Toda

cs.CL2025

PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation

Jiajun He, Naoki Sawada, Koichi Miyazaki +1

eess.AS2022

A Cyclical Approach to Synthetic and Natural Speech Mismatch Refinement of Neural Post-filter for Low-cost Text-to-speech System

Yi-Chiao Wu, Patrick Lumban Tobing, Kazuki Yasuhara +3

cs.SD2022

Music Similarity Calculation of Individual Instrumental Sounds Using Metric Learning

Yuka Hashizume, Li Li, Tomoki Toda

cs.SD2023

An Analysis of Personalized Speech Recognition System Development for the Deaf and Hard-of-Hearing

Lester Phillip Violeta, Tomoki Toda

eess.AS2019

Non-Parallel Voice Conversion with Cyclic Variational Autoencoder

Patrick Lumban Tobing, Yi-Chiao Wu, Tomoki Hayashi +2

eess.AS2018

Collapsed speech segment detection and suppression for WaveNet vocoder

Yi-Chiao Wu, Kazuhiro Kobayashi, Tomoki Hayashi +2

cs.SD2025

XPPG-PCA: Reference-free automatic speech severity evaluation with principal components

Bence Mark Halpern, Thomas B. Tienkamp, Teja Rebernik +5

eess.AS2025

Unifying Listener Scoring Scales: Comparison Learning Framework for Speech Quality Assessment and Continuous Speech Emotion Recognition

Cheng-Hung Hu, Yusuke Yasuda, Akifumi Yoshimoto +1

eess.AS2022

Analysis of Noisy-target Training for DNN-based speech enhancement

Takuya Fujimura, Tomoki Toda

eess.AS2023

NNSVS: A Neural Network-Based Singing Voice Synthesis Toolkit

Ryuichi Yamamoto, Reo Yoneyama, Tomoki Toda

eess.AS2020

Many-to-Many Voice Transformer Network

Hirokazu Kameoka, Wen-Chin Huang, Kou Tanaka +3

cs.CL2020

ESPnet-TTS: Unified, Reproducible, and Integratable Open Source End-to-End Text-to-Speech Toolkit

Tomoki Hayashi, Ryuichi Yamamoto, Katsuki Inoue +6

eess.AS2017

A modulation property of time-frequency derivatives of filtered phase and its application to aperiodicity and fo estimation

Hideki Kawahara, Ken-Ichi Sakakibara, Masanori Morise +2