1 paper · 1 filter
Didier Sornette, Sandro Claudio Lera, Ke Wu
Recent reports of large language models (LLMs) exhibiting behaviors such as deception, threats, or blackmail are often interpreted as evidence of alignment failure or emergent mali…