1 paper · 1 filter
Liang Wang, Junpeng Wang, Chin-chia Michael Yeh +6
Large Language Models (LLMs) are increasingly used as evaluators of reasoning quality, yet their reliability and bias in payments-risk settings remain poorly understood. We introdu…