1 paper
Claudia Herambourg, Dawid Siuda, Julia KopczyÅska +3
We present ORCA (Omni Research on Calculation in AI) Benchmark - a novel benchmark that evaluates large language models (LLMs) on multi-domain, real-life quantitative reasoning usi…