1 paper
Surender Suresh Kumar, Mary L. Cummings
Safety defenses for large language models (LLMs) are typically trained and evaluated on single-turn prompts, yet real attacks often unfold as indirect, multi-turn probing. To defen…