1 paper
Prateek Biswas, Dhaval Patel, Vedant Khandelwal +2
Multiple-choice QA benchmarks usually evaluate small language models (SLMs) as direct answerers, but deployed language-model systems increasingly rely on external scaffolds such as…