1 paper · 1 filter
Yusuke Sakai, Adam Nohejl, Jiangnan Hang +2
The natural language understanding (NLU) performance of large language models (LLMs) has been evaluated across various tasks and datasets. The existing evaluation methods, however,…