2 papers
cs.CL2026
Rank Reversal in Multilingual LLM Judges: A Label-Free Double-Centering Calibrator
Alhasan Mahmood, Samir Abdaljalil, Hasan Kurban
Multilingual LLM judges produce different evaluator-backbone rankings depending on the prompt language: on an eight-language Agent-as-a-Judge benchmark, the top-ranked backbone alt…
cs.CL2026
Multilingual Prompt Localization for Agent-as-a-Judge: Language and Backbone Sensitivity in Requirement-Level Evaluation
Alhasan Mahmood, Samir Abdaljalil, Hasan Kurban
Evaluation language is typically treated as a fixed English default in agentic code benchmarks, yet we show that changing the judge's language can invert backbone rankings. We loca…