1 paper
Rima Hazra, Bikram Ghuku, Ilona Marchenko +5
Large language models are rapidly being deployed as AI tutors, yet current evaluation paradigms assess problem-solving accuracy and generic safety in isolation, failing to capture…