1 paper · 1 filter
Sihao Wu, Gaojie Jin, Wei Huang +2
Vision Language Models (VLMs) have demonstrated impressive capabilities in integrating visual and textual information for understanding and reasoning, but remain highly vulnerable…