1 paper · 1 filter
Ngoc Dung Huynh, Mohamed Reda Bouadjenek, Imran Razzak +2
Large vision and language models show strong performance in tasks like image captioning, visual question answering, and retrieval. However, challenges remain in integrating speech,…