1 paper · 1 filter
Tzu-Heng Huang, Sirajul Salekin, Javier Movellan +2
Dense image captioning is critical for cross-modal alignment in vision-language pretraining and text-to-image generation, but scaling expert-quality annotations is prohibitively ex…