2 papers
cs.CV2026
VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation
Walid Bousselham, Hilde Kuehne, Cordelia Schmid
Training vision-language models (VLMs) for complex reasoning remains a challenging task, i.a. due to the scarcity of high-quality image-text reasoning data. Conversely, text-based…
cs.CV2026
What Drives Compositional Generalization? The Importance of Continuous Training Objectives in Visual Generative Models
Karim Farid, Rajat Sahay, Yumna Ali Alnaggar +4
Compositional generalization, the ability to generate novel combinations of known concepts, is a key ingredient for visual generative models. Yet, not all mechanisms that enable or…