1 paper · 1 filter
Jianing Li, Xi Nan, Ming Lu +2
Multi-modal large language models (MLLMs) have demonstrated remarkable vision-language capabilities, primarily due to the exceptional in-context understanding and multi-task learni…