2 papers
cs.CL2025
LatentBreak: Jailbreaking Large Language Models through Latent Space Feedback
Raffaele Mura, Giorgio Piras, KamilÄ LukoÅ¡iÅ«tÄ +3
Jailbreaks are adversarial attacks designed to bypass the built-in safety mechanisms of large language models. Automated jailbreaks typically optimize an adversarial suffix or adap…
cs.AI2025
Gödel Test: Can Large Language Models Solve Easy Conjectures?
Moran Feldman, Amin Karbasi
Recent announcements from frontier AI model labs have highlighted strong results on high-school and undergraduate math competitions. Yet it remains unclear whether large language m…