1 paper
Yuqian Yuan, Wenqiao Zhang, Juekai Lin +7
Large Multimodal Models (LMMs) have achieved remarkable progress in general-purpose vision--language understanding, yet they remain limited in tasks requiring precise object-level…