1 paper · 1 filter
Huda Khayrallah, Zuhaib Akhtar, Edward Cohen +2
We release MMSMR, a Massively Multi-System MultiReference dataset to enable future work on metrics and evaluation for dialog. Automatic metrics for dialogue evaluation should be ro…