1 paper
Jingru Yang, Huan Yu, Yang Jingxin +4
Multimodal Large Language Models (MLLMs) excel at descriptive tasks within images but often struggle with precise object localization, a critical element for reliable visual interp…