Showing cs.SDShow all
3 papers · 1 filter
cs.SD2026
Taming Long-form Text-to-Speech
Rongxiang Wang, Berkin Durmus, Aysegul Orhon +2
Long-form text-to-speech (TTS) enables multi-turn conversations with consistent prosody and higher quality voice cloning from longer reference audio. Recent open-weights autoregres…
cs.SD2025
SDBench: A Comprehensive Benchmark Suite for Speaker Diarization
Eduardo Pacheco, Atila Orhon, Berkin Durmus +2
Even state-of-the-art speaker diarization systems exhibit high variance in error rates across different datasets, representing numerous use cases and domains. Furthermore, comparin…
cs.SD2025
WhisperKit: On-device Real-time ASR with Billion-Scale Transformers
Atila Orhon, Arda Okan, Berkin Durmus +2
Real-time Automatic Speech Recognition (ASR) is a fundamental building block for many commercial applications of ML, including live captioning, dictation, meeting transcriptions, a…