1 paper
Yuhan Lu, Yi Yao, Hua Shen +2
Multimodal large language models (MLLMs) are increasingly used as evaluators, yet their reliability in professional assessment tasks that require expert judgment remains unclear. W…