1 paper
Anna Deichler, Jim O'Regan, Fethiye Irmak Dogan +4
Grounding language in the physical world requires AI systems to interpret references that emerge dynamically during conversation. While current vision-language models (VLMs) excel…