2 papers
cs.CV2026
UniSpace: Unified Visual Representation and Scalable Multimodal Modeling
Jinbo Yan, Limeng Qiao, Jie Qin +3
Semantic vision encoders have become a central visual interface for multimodal understanding and semantic conditioning in image generation. However, their final tokens discard fine…
cs.CV2026
DiffusionAgent: Navigating Expert Models for Agentic Image Generation
Jie Qin, Jie Wu, Weifeng Chen +1
In the accelerating era of human-instructed visual content creation, diffusion models have demonstrated remarkable generative potential. Yet their deployment is constrained by a du…