1 paper · 1 filter
Yiwei Ma, Guohai Xu, Xiaoshuai Sun +4
Visual instruction tuning (VIT) has emerged as a crucial technique for enabling multi-modal large language models (MLLMs) to follow user instructions adeptly. Yet, a significant ga…