2 papers
cs.CV2024
Mitigating Adversarial Attacks in LLMs through Defensive Suffix Generation
Minkyoung Kim, Yunha Kim, Hyeram Seo +9
Large language models (LLMs) have exhibited outstanding performance in natural language processing tasks. However, these models remain susceptible to adversarial attacks in which s…
cs.CL2024
Multi-Response Preference Optimization with Augmented Ranking Dataset
Hansle Gwon, Imjin Ahn, Young-Hak Kim +2
Recent advancements in Large Language Models (LLMs) have been remarkable, with new models consistently surpassing their predecessors. These advancements are underpinned by extensiv…