Showing cs.CVShow all
2 papers · 1 filter
cs.CV2025
Visual Test-time Scaling for GUI Agent Grounding
Tiange Luo, Lajanugen Logeswaran, Justin Johnson +1
We introduce RegionFocus, a visual test-time scaling approach for Vision Language Model Agents. Understanding webpages is challenging due to the visual complexity of GUI images and…
cs.CV2025
Probing Visual Language Priors in VLMs
Tiange Luo, Ang Cao, Gunhee Lee +2
Despite recent advances in Vision-Language Models (VLMs), they may over-rely on visual language priors existing in their training data rather than true visual reasoning. To investi…