1 paper · 1 filter
Xiuyuan Chen, Jian Zhao, Yuchen Yuan +8
Existing safety evaluation methods for large language models (LLMs) suffer from inherent limitations, including evaluator bias and detection failures arising from model homogeneity…