1 paper
Sergios Gatidis, Curtis Langlotz, Christian Bluethgen
Vision-language models (VLMs) pretrained on large-scale image-text pairs demonstrate strong image-level understanding, but are primarily optimized for global alignment and do not e…