2 papers
cs.LG2026
A Unified Perturbation Framework for Analyzing Leaderboard Stability and Manipulation
Hosna Oyarhoseini, Jimmy Lin, Amir-Hossein Karimi
Evaluation leaderboards such as LMArena play a central role in benchmarking large language models by aggregating pairwise human preferences into model rankings, yet the robustness…
cs.CL2026
Unifying Adversarial Robustness and Training Across Text Scoring Models
Manveer Singh Tamber, Hosna Oyarhoseini, Jimmy Lin
Research on adversarial robustness in language models is currently fragmented across applications and attacks, obscuring shared vulnerabilities. In this work, we propose unifying t…