1 paper
Mohammed Saidul Islam, Negin Baghbanzadeh, Farnaz Kohankhaki +5
Evaluation of foundation models often rely on aggregate scores from benchmarks that lack comprehensive coverage and metadata for a fine-grained evaluation. We introduce a framework…