1 paper · 1 filter
Zekai Chen, Arda Pekis, Kevin Brown
Multi-modal learning has significantly advanced generative AI, especially in vision-language modeling. Innovations like GPT-4V and open-source projects such as LLaVA have enabled r…