1 paper
Beomchan Park, Seongho Kim, Hyunjun Kim +2
While Multimodal Large Language Models (MLLMs) have enhanced grounding capabilities in general scenes, their robustness in crowded scenes remains underexplored. Crowded scenes enta…