1 paper
Yuan Shen, Xiaojun Wu, Linghua Yu
Large language models (LLMs) are entering clinical practice based on benchmark accuracy that may fail to detect safety-relevant failure modes. Here we present AI-MASLD, a stress-au…