1 paper · 1 filter
Jeffrey Seely, Yuki Imajuku, Tianyu Zhao +2
Existing reasoning benchmarks for large language models (LLMs) frequently fail to capture authentic creativity, often rewarding memorization of previously observed patterns. We add…