1 paper
Wenzhuo Liu, Fei Zhu, Haiyang Guo +2
Multimodal models like LLaVA-1.5 achieve state-of-the-art visual understanding through visual instruction tuning on multitask datasets, enabling strong instruction-following and mu…