1 paper
Sagarika Banerjee, Tangatar Madi, Advait Swaminathan +4
Fine-grained image-caption alignment is crucial for vision-language models (VLMs), especially in socially critical contexts such as identifying real-world risk scenarios or disting…