1 paper
Vijitha Mittapalli, Shreyaa Jayant Dani, Satya Srujana Pilli +7
Autonomous LLM agents can pursue hidden malicious objectives through sequences of individually benign actions, making sabotage difficult to detect using standard trajectory-level m…