1 paper
Xirui Zhou, Lianlei Shan, Xiaolin Gui
Visual Question Answering (VQA) models, which fall under the category of vision-language models, conventionally execute multiple downsampling processes on image inputs to strike a…