3 citations · 3 across the 2 of their papers we have counts for
3 papers
cs.CL2026
Beyond English: Uncovering the Multilingual Gap in Vision-Language-Action Models
Hanyang Chen, Hongliang Li, Jiarui Cao +6
Vision-Language-Action models have recently demonstrated promising capabilities in learning generalist robot policies from large-scale multimodal data. However, most existing VLA s…
cs.MM2024
MM-InstructEval: Zero-Shot Evaluation of (Multimodal) Large Language Models on Multimodal Reasoning Tasks
Xiaocui Yang, Wenfang Wu, Shi Feng +7
The emergence of multimodal large language models (MLLMs) has triggered extensive research in model evaluation. While existing evaluation studies primarily focus on unimodal (visio…
cs.CL2023★ 3 cited
MM-BigBench: Evaluating Multimodal Models on Multimodal Content Comprehension Tasks
Xiaocui Yang, Wenfang Wu, Shi Feng +7
The popularity of multimodal large language models (MLLMs) has triggered a recent surge in research efforts dedicated to evaluating these models. Nevertheless, existing evaluation…