3 papers
cs.CV2026
UFO: Chain-of-Evaluation for Omni-Condition Alignment in Multi-Modal Image Generation
Danning Zhang, Yijing Lin, Shuhan Zhuang +4
Multi-modal image generation, particularly subject-driven customization, has garnered growing attention in recent years. Despite the rapid advancement of generative models, their e…
cs.CV2025
HDGlyph: A Hierarchical Disentangled Glyph-Based Framework for Long-Tail Text Rendering in Diffusion Models
Shuhan Zhuang, Mengqi Huang, Fengyi Fu +3
Visual text rendering, which aims to accurately integrate specified textual content within generated images, is critical for various applications such as commercial design. Despite…
cs.CV2025
RealGeneral: Unifying Visual Generation via Temporal In-Context Learning with Video Models
Yijing Lin, Mengqi Huang, Shuhan Zhuang +1
Unifying diverse image generation tasks within a single framework remains a fundamental challenge in visual generation. While large language models (LLMs) achieve unification throu…