3 papers
cs.NE2026
Distributed Quality-Diversity Search for Toxicity in Large Language Models
Onkar Shelar, Travis Desell
Large Language Models remain vulnerable to adversarial prompts that elicit harmful responses, and scaling red-teaming to cover a broad range of failure modes is constrained by the…
cs.NE2026
Diversifying Toxicity Search in Large Language Models Through Speciation
Onkar Shelar, Travis Desell
Evolutionary prompt search is a practical black-box approach for red teaming large language models, however existing methods often collapse onto a small family of high-performing p…
cs.NE2026
ToxSearch: Evolving Prompts for Toxicity Search in Large Language Models
Onkar Shelar, Travis Desell
Large Language Models remain vulnerable to adversarial prompts that elicit toxic content even after safety alignment. We present ToxSearch, a black-box evolutionary framework that…