1 paper
Alexey Krylov, Iskander Vagizov, Dmitrii Korzh +6
Large Language Models (LLMs), especially their compact efficiency-oriented variants, remain susceptible to jailbreak attacks that can elicit harmful outputs despite extensive align…