1 paper
Kaito Tanaka, Benjamin Tan, Brian Wong
Vision-Language Models (VLMs) have emerged as key enablers for multimodal tasks, but their reliance on separate visual encoders introduces challenges in efficiency, scalability, an…