1 paper
Yusuke Sakai, Adam Nohejl, Jiangnan Hang +2
The natural language understanding (NLU) performance of large language models (LLMs) has been evaluated across various tasks and datasets. The existing evaluation methods, however,…