1 paper · 1 filter
Yanda Li, Yuhan Liu, Zirui Song +3
Large audio-language models (LALMs) generalize across speech, sound, and music, but unified decoders can exhibit a \emph{temporal smoothing bias}: transient acoustic cues may be un…