1 paper · 1 filter
Marco Mistretta, Alberto Baldrati, Marco Bertini +1
Vision-Language Models (VLMs) demonstrate remarkable zero-shot generalization to unseen tasks, but fall short of the performance of supervised methods in generalizing to downstream…