1 paper · 1 filter
Nurit Cohen-Inger, Yehonatan Elisha, Bracha Shapira +2
Large language models (LLMs) often appear to excel on public benchmarks, but these high scores may mask an overreliance on dataset-specific surface cues rather than true language u…