2 papers
cs.CV2026
Where To Look? : Causal Tracing of Vision Encoders in VLM
Naren Kumar S, Tirth Bhatt, Mayank Singh
Vision-language models can describe an image with remarkable accuracy, yet a more fundamental question remains unanswered: what visual information actually drives their answers? In…
cs.CL2026
Task-Conditional Flow Matching for Balanced Multilingual Text Embedding Adaptation
Tirth Bhatt, Naren Kumar S, Mayank Singh
Multilingual text embedding models are commonly adapted using a single training objective across diverse tasks, despite different tasks requiring fundamentally different optimizati…