1 citations · 1 across the 1 of their papers we have counts for
1 paper
Vasu Singla, Kaiyu Yue, Sukriti Paul +7
Training large vision-language models requires extensive, high-quality image-text pairs. Existing web-scraped datasets, however, are noisy and lack detailed image descriptions. To…