2 papers
cs.CV2025
Journey Before Destination: On the importance of Visual Faithfulness in Slow Thinking
Rheeya Uppaal, Phu Mon Htut, Min Bai +3
Reasoning-augmented vision language models (VLMs) generate explicit chains of thought that promise greater capability and transparency but also introduce new failure modes: models…
cs.AI2025
Cross-Modal Content Optimization for Steering Web Agent Preferences
Tanqiu Jiang, Min Bai, Nikolaos Pappas +2
Vision-language model (VLM)-based web agents increasingly power high-stakes selection tasks like content recommendation or product ranking by combining multimodal perception with p…