1 paper · 1 filter
Shuai Zhang, Jiayu Hu, Zijie Chen +9
Current embodied VLM evaluation relies on static, expert-defined, manually annotated benchmarks that exhibit severe redundancy and coverage imbalance. This labor intensive paradigm…