1 paper
Zhehan Kan, Xinghua Jiang, Yubo Zhu +10
Despite remarkable advancements in multimodal large language models (MLLMs), their fine-grained visual understanding is constrained by a primary reliance on sparse textual supervis…