2 papers
cs.CV2026
Composition-Grounded Data Synthesis for Visual Reasoning
Xinyi Gu, Jiayuan Mao, Zhang-Wei Hong +5
Pretrained multi-modal large language models (MLLMs) demonstrate strong performance on diverse multimodal tasks, but remain limited in reasoning capabilities for domains where anno…
cs.CV2026
Generating Fine Details of Entity Interactions
Xinyi Gu, Jiayuan Mao
Recent text-to-image models excel at generating high-quality object-centric images from instructions. However, images should also encapsulate rich interactions between objects, whe…