Showing cs.CVShow all
3 papers · 1 filter
cs.CV2025
Semantic-Preserving Cross-Style Visual Reasoning for Robust Multi-Modal Understanding in Large Vision-Language Models
Aya Nakayama, Brian Wong, Yuji Nishimura +1
The "style trap" poses a significant challenge for Large Vision-Language Models (LVLMs), hindering robust semantic understanding across diverse visual styles, especially in in-cont…
cs.CV2024
Optimizing Vision-Language Interactions Through Decoder-Only Models
Kaito Tanaka, Benjamin Tan, Brian Wong
Vision-Language Models (VLMs) have emerged as key enablers for multimodal tasks, but their reliance on separate visual encoders introduces challenges in efficiency, scalability, an…
cs.CV2024
An Application-Agnostic Automatic Target Recognition System Using Vision Language Models
Anthony Palladino, Dana Gajewski, Abigail Aronica +8
We present a novel Automatic Target Recognition (ATR) system using open-vocabulary object detection and classification models. A primary advantage of this approach is that target c…