2 papers
cs.CV2025
Cure or Poison? Embedding Instructions Visually Alters Hallucination in Vision-Language Models
Zhaochen Wang, Yiwei Wang, Yujun Cai
Vision-Language Models (VLMs) often suffer from hallucination, partly due to challenges in aligning multimodal information. We propose Prompt-in-Image, a simple method that embeds…
cs.CV2025
Text Speaks Louder than Vision: ASCII Art Reveals Textual Biases in Vision-Language Models
Zhaochen Wang, Bryan Hooi, Yiwei Wang +3
Vision-language models (VLMs) have advanced rapidly in processing multimodal information, but their ability to reconcile conflicting signals across modalities remains underexplored…