1 paper · 1 filter
Viet-Thanh Pham, Lizhen Qu, Thuy-Trang Vu +2
Large language models (LLMs) are increasingly deployed as autonomous agents, yet evaluations focus primarily on task success rather than cultural appropriateness or evaluator relia…