1 paper
Varun Ananth, Baqiao Liu, Haoran Cai
Caption quality has emerged as a critical bottleneck in training high-quality text-to-image (T2I) and text-to-video (T2V) generative models. While visual language models (VLMs) are…