1 paper
Ya-Qi Yu, Minghui Liao, Jiwen Zhang +1
Reading dense text and locating objects within images are fundamental abilities for Large Vision-Language Models (LVLMs) tasked with advanced jobs. Previous LVLMs, including superi…