1 paper
Weichen Yu, Ziyan Yang, Shanchuan Lin +5
In text-to-image (T2I) generation, a prevalent training technique involves utilizing Vision Language Models (VLMs) for image re-captioning. Even though VLMs are known to exhibit ha…