1 paper
Khang Nguyen Quoc, Phuong D. Dao, Luyl-Da Quach
Foundation models and vision-language pre-training have significantly advanced Vision-Language Models (VLMs), enabling multimodal processing of visual and linguistic data. However,…