1 paper · 1 filter
Minseok Kang, Hyunwoo Kim, Chanyoung Kim +3
Vision-language models (VLMs) have achieved remarkable generalization across diverse multimodal tasks through large-scale pre-training, yet their rapidly increasing computational a…