1 paper · 1 filter
Jiale Luo, Xiaoyu Liang, Haoji Hu
Audio-language models (ALMs) are increasingly used for audio captioning, question answering, and open-ended audio understanding, but their inference cost remains high when audio in…