1 paper · 1 filter
Declan Jackson, William Keating, George Cameron +1
Existing language model evaluations primarily measure general capabilities, yet reliable use of these models across a range of domains demands factual accuracy and recognition of k…