1 paper
Albert Gong, KamilÄ StankeviÄiÅ«tÄ, Chao Wan +6
High-quality benchmarks are essential for evaluating reasoning and retrieval capabilities of large language models (LLMs). However, curating datasets for this purpose is not a perm…