1 paper
Videet Mehta, Liming Wang, Hilde Kuehne +3
Large audio-language models (LALMs) exhibit strong zero-shot capabilities in multiple downstream tasks, such as audio question answering (AQA) and abstract reasoning; however, thes…