1 paper
Balu Bhasuran, Mattia Prosperi, Karim Hanna +3
This study evaluates causal reasoning in large language models (LLMs) using 99 clinically grounded laboratory test scenarios aligned with Pearl's Ladder of Causation: association,…