1 paper
Yalun Wu, Junfeng Fang, Jiawei Wang +6
Evaluating large language models (LLMs) in safety-critical, physics-governed environments requires more than accuracy-based metrics, because predictions that are numerically close…