1 paper
Jiangtong Tan, Lin Liu, Jie Huanng +3
Unified multimodal models significantly improve visual generation by combining vision-language models (VLMs) with diffusion models. However, existing methods struggle to fully bala…