1 paper
Amith Ananthram, Elias Stengel-Eskin, Lorena A. Bradford +7
While vision-language models (VLMs) have advanced into detailed image description, evaluation remains a challenge. Standard metrics (e.g. CIDEr, SPICE) were designed for short text…