8 citations · 11 across the 5 of their papers we have counts for
1 paper · 1 filter
Santhosh Kumar Ravindran
Large language models (LLMs) aligned for safety through techniques like reinforcement learning from human feedback (RLHF) often exhibit emergent deceptive behaviors, where outputs…