1 paper
Haidar Khan, Hisham A. Alyahya, Yazeed Alnumay +2
Evaluating the capabilities of Large Language Models (LLMs) has traditionally relied on static benchmark datasets, human assessments, or model-based evaluations - methods that ofte…