1 paper · 1 filter
Will Yeadon, Tom Hardy, Paul Mackay +1
As large language models (LLMs) are increasingly considered for automated assessment and feedback, understanding when LLM marking is valid is essential. We evaluate LLM-as-a-judge…