1 paper
Sary Elmansoury, Islam Mesabah, Gerrit GroÃmann +4
Vision language models (VLMs) excel at zero-shot visual classification, but their performance on fine-grained tasks and large hierarchical label spaces is understudied. This paper…