1 paper · 1 filter
Hejie Cui, Lingjun Mao, Xin Liang +5
Recent advancements in multimodal foundation models have showcased impressive capabilities in understanding and reasoning with visual and textual information. Adapting these founda…