1 paper
Fabio Rosenthal, Sebastian Schmidt, Thorsten Graf +3
Multimodal Large Language Models (MLLMs) demonstrate strong capabilities in handling image-text inputs. A common way to assess this ability is through multiple-choice Visual Questi…