1 paper · 1 filter
Mohammed Saidul Islam, Negin Baghbanzadeh, Farnaz Kohankhaki +5
Evaluation of foundation models often rely on aggregate scores from benchmarks that lack comprehensive coverage and metadata for a fine-grained evaluation. We introduce a framework…