1 paper
YiJie Huang, Yiqun Zhang, Zhuoyue Jia +7
Vision-language models improve perception by feeding increasingly long visual token sequences into language backbones, but the resulting inference cost raises a basic scaling quest…