1 paper
Yuxi Zhang, Yueting Li, Xinyu Du +1
Generating images from rhetorical languages remains a critical challenge for text-to-image models. Even state-of-the-art (SOTA) multimodal large language models (MLLM) fail to gene…