1 paper
Claudia Herambourg, Dawid Siuda, Julia Kopczyńska +3
We present ORCA (Omni Research on Calculation in AI) Benchmark - a novel benchmark that evaluates large language models (LLMs) on multi-domain, real-life quantitative reasoning usi…