1 paper
Mukund Agarwalla, Himanshu Kumar, Raj Dandekar +2
Vision-Language Models (VLMs), such as GPT-4V and Llama 3.2 vision, have garnered significant research attention for their ability to leverage Large Language Models (LLMs) in multi…