1 paper · 1 filter
Jason Starace, Bert Baumgaertner, Terence Soule
Deceptive behavior in AI systems is no longer theoretical: large language models strategically mislead without producing false statements, maintain deceptive strategies through saf…