1 paper · 1 filter
Sixun Dong, Juhua Hu, Mian Zhang +3
Vision-Language Models (VLMs) demonstrate impressive performance in understanding visual content with language instruction by converting visual inputs to vision tokens. However, re…