1 paper · 1 filter
Changyi Li, Pengfei Lu, Xudong Pan +2
As Large Language Models (LLMs) evolve into autonomous agents, existing safety evaluations face a fundamental trade-off: manual benchmarks are costly, while LLM-based simulators ar…