1 paper · 1 filter
Yongan Yu, Mengqian Wu, Yiran Lin +1
Assessing higher-order thinking skills in large language models (LLMs) remains a fundamental challenge, especially in tasks that go beyond surface-level accuracy. In this work, we…