1 paper
Amirhossein Abaskohi, Amirhossein Dabiriaghdam, Liang Luo +4
We introduce UnpredictaBench, an evaluation that tests the ability of large language models (LLMs) to capture true underlying distributions. As LLMs are increasingly used as substi…