1 paper
Qi Jia, Xiang Yue, Tianyu Zheng +2
We introduce SimulBench, a benchmark designed to evaluate large language models (LLMs) across a diverse collection of creative simulation scenarios, such as acting as a Linux termi…