1 paper
Oanh N. Tran, Thanh Quoc Hung Le, Oscar Chew +2
Vision-Language Models (VLMs) struggle as query-relevant objects become smaller. To address this, recent training-free approaches dynamically retrieve and zoom into local image reg…