1 paper
Roman Prosvirnin, Victor Minchenkov, Alexey Soldatov +2
Jailbreak-robustness research typically evaluates safety through generated responses using an LLM-as-judge approach. Such evaluations, however, are sensitive to the benchmark's gra…