1 paper · 1 filter
Xiaonan Luo, Yue Huang, Ping He +1
High-quality Question-Answer (QA) datasets are foundational for reliable Large Language Model (LLM) evaluation, yet even expert-crafted datasets exhibit persistent gaps in domain c…