1 paper · 1 filter
Gowrav Mannem, Chowdhury Marzia Mahjabin, Jason Chen +2
Large language models often appear strong on symbolic and algorithmic tasks, yet this apparent strength can hide brittle behaviour when problems become longer, harder, or slightly…