1 paper
Xinheng Han, Jianfei Wang, Yu Chen +4
Multimodal Large Language Models (MLLMs) are increasingly expected to solve structured perception tasks that require visual recognition, language-to-object binding, object cardinal…