2 papers
cs.CV2026
CORE-Seg: Reasoning-Driven Segmentation for Complex Lesions via Reinforcement Learning
Yuxin Xie, Yuming Chen, Yishan Yang +5
Medical image segmentation is undergoing a paradigm shift from conventional visual pattern matching to cognitive reasoning analysis. Although Multimodal Large Language Models (MLLM…
cs.CV2024
Empowering Backbone Models for Visual Text Generation with Input Granularity Control and Glyph-Aware Training
Wenbo Li, Guohao Li, Zhibin Lan +5
Diffusion-based text-to-image models have demonstrated impressive achievements in diversity and aesthetics but struggle to generate images with legible visual texts. Existing backb…