2 papers
cs.CL2026
M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models
Ryo Fukuda, Atsushi Ando, Hiroki Kanagawa +4
Full-duplex spoken dialogue systems (FDSDSs) can listen while speaking, enabling natural behaviors such as smooth turn-taking, backchannel handling, and user barge-in handling. How…
cs.SD2025
Multi-interaction TTS toward professional recording reproduction
Hiroki Kanagawa, Kenichi Fujita, Aya Watanabe +1
Voice directors often iteratively refine voice actors' performances by providing feedback to achieve the desired outcome. While this iterative feedback-based refinement process is…