1 paper · 1 filter
Max McGuinness, Alex Serrano, Luke Bailey +1
Activation monitoring, which probes a model's internal states using lightweight classifiers, is an emerging tool for AI safety. However, its worst-case robustness under a misalignm…