1 paper
Zhipeng Liu, Haochen Wang, Zhaoxiang Zhang
Captions serve as a primary supervision signal for both multimodal understanding and text-to-image generation. However, previous evaluations treat the caption quality as a single s…