1 paper
Matteo Migliarini, Joaquin Pereira Pizzini, Luca Moresca +3
Instrumental convergence predicts that sufficiently advanced AI agents will resist shutdown, yet current safety training (RLHF) may obscure this risk by teaching models to deny sel…