1 paper · 1 filter
Weiliang Zhao, Daniel Ben-Levi, Wei Hao +2
We have uncovered a powerful jailbreak technique that leverages large language models' ability to diverge from prior context, enabling them to bypass safety constraints and generat…