Showing cs.SDShow all
3 papers · 1 filter
cs.SD2026
Edge-Cloud Collaborative Speech Emotion Captioning via Token-Level Speculative Decoding in Audio-Language Models
Xiangyuan Xue, Jiajun Lu, Yan Gao +3
Speech Emotion Captioning (SEC) leverages large audio-language models to generate rich, context-aware affective descriptions from speech. However, real-world deployment remains cha…
cs.SD2026
Decoding Ambiguous Emotions with Test-Time Scaling in Audio-Language Models
Hong Jia, Weibin Li, Jingyao Wu +6
Emotion recognition from human speech is a critical enabler for socially aware conversational AI. However, while most prior work frames emotion recognition as a categorical classif…
cs.SD2025
Scaling Auditory Cognition via Test-Time Compute in Audio Language Models
Ting Dang, Yan Gao, Hong Jia
Large language models (LLMs) have shown exceptional versatility in natural language processing, prompting recent efforts to extend their multimodal capabilities to speech processin…