2 papers
cs.CV2026
Improving Reasoning in Vision-Language Models via Perception Verified Self-Training
Sourabh Sharma, Sonam Gupta, Sadbhawna
Achieving human-like reasoning in Vision-Language Models (VLMs) remains a long-standing challenge. Recent approaches leverage Chain-of-Thought (CoT) rationales generated by human a…
cs.CV2026
See, Think, Learn: A Self-Taught Multimodal Reasoner
Sourabh Sharma, Sonam Gupta, Sadbhawna
Vision-Language Models (VLMs) have achieved remarkable progress in integrating visual perception with language understanding. However, effective multimodal reasoning requires both…