1 paper · 1 filter
Caleb DeLeeuw, Gaurav Chawla, Aniket Sharma +1
We investigate strategic deception in large language models using two complementary testbeds: Secret Agenda (across 38 models) and Insider Trading compliance (via SAE architectures…