1 paper · 1 filter
Dasol Choi, Alex Kwon
Safety benchmark scores provide incomplete evidence of deployment readiness: aligned language models often adhere to rigid rules even when a situational update flips which action i…