1 paper · 1 filter
Zhehan Kan, Xinghua Jiang, Yubo Zhu +10
Despite remarkable advancements in multimodal large language models (MLLMs), their fine-grained visual understanding is constrained by a primary reliance on sparse textual supervis…