1 paper
Jonas van Elburg, Peter van der Putten, Maarten Marx
We investigate whether synthetic question-answer (QA) data generated by large language models (LLMs) can serve as an effective proxy for human-labeled benchmarks when the latter is…