1 paper · 1 filter
Yijie Hong, Xiaofei Yin, Xinzhong Wang +7
Large Vision Language Models have demonstrated impressive versatile capabilities through extensive multimodal pre-training, but face significant limitations when incorporating spec…