1 paper · 1 filter
Surendra Pathak, Bo Han
While Large Vision-Language Models (LVLMs) demonstrate exceptional multi-modal capabilities, the quadratic computational cost of processing high-resolution visual tokens remains a…