2 papers
cs.CL2026
Beyond English: Uncovering the Multilingual Gap in Vision-Language-Action Models
Hanyang Chen, Hongliang Li, Jiarui Cao +6
Vision-Language-Action models have recently demonstrated promising capabilities in learning generalist robot policies from large-scale multimodal data. However, most existing VLA s…
cs.MM2025
MM-InstructEval: Zero-Shot Evaluation of (Multimodal) Large Language Models on Multimodal Reasoning Tasks
Xiaocui Yang, Wenfang Wu, Shi Feng +7
The emergence of multimodal large language models (MLLMs) has triggered extensive research in model evaluation. While existing evaluation studies primarily focus on unimodal (visio…