1 paper · 1 filter
Dan Ristea, Vasilios Mavroudis
We introduce HonestCyberEval, a new benchmark for assessing AI models' capabilities and risks in automated software exploitation, focusing on their ability to detect and exploit vu…