1 paper · 1 filter
Andrew Kiruluta, Preethi Raju, Priscilla Burity
Vision-Language Models (vLLMs) have emerged as powerful architectures for joint reasoning over visual and textual inputs, enabling breakthroughs in image captioning, cross modal re…