Showing cs.SDShow all
2 papers · 1 filter
cs.SD2026
Stride-k Subsampling: Train-Free Audio Token Reduction for Whisper
Chanhee Cho, Junhyuk Choi, Bugeun Kim
Whisper exposes speech through a fixed 1500-token encoder interface, now a default representation for ASR decoders and Whisper-based speech language models (SpeechLMs), yet its red…
cs.SD2026
SPAM: Style Prompt Adherence Metric for Prompt-based TTS
Chanhee Cho, Nayeon Kim, Bugeun Kim
Prompt-based text-to-speech (TTS) aims to generate speech that adheres to fine-grained style cues provided in a text prompt. However, most prior works depend on neither plausible n…