1 paper
Matteo Spanio, Mohammad Torabi, Andrea Poltronieri +1
Symbolic music evaluation for large language models remains fragmented across representations, datasets, and metrics. We introduce LilyBench, a LilyPond-based benchmark that jointl…