2 papers
cs.CV2025
SCRAMBLe : Enhancing Multimodal LLM Compositionality with Synthetic Preference Data
Samarth Mishra, Kate Saenko, Venkatesh Saligrama
Compositionality, or correctly recognizing scenes as compositions of atomic visual concepts, remains difficult for multimodal large language models (MLLMs). Even state of the art M…
cs.CV2025
SPARC: Score Prompting and Adaptive Fusion for Zero-Shot Multi-Label Recognition in Vision-Language Models
Kevin Miller, Samarth Mishra, Aditya Gangrade +2
Zero-shot multi-label recognition (MLR) with Vision-Language Models (VLMs) faces significant challenges without training data, model tuning, or architectural modifications. Existin…