1 paper · 1 filter
Taichi Nishimura, Shota Nakada, Masayoshi Kondo
Large audio-video language models can generate descriptions for both video and audio. However, they sometimes ignore audio content, producing audio descriptions solely reliant on v…