3 papers
cs.CR2026
When Efficiency Backfires: Cascading LLMs Trigger Cascade Failure under Adversarial Attack
Zehan Sun, Dingfan Chen, Songze Li
Large Language Model (LLM) cascade systems are designed to balance efficiency and performance by processing queries with lightweight models while selectively escalating complex cas…
cs.CR2025
Jailbreaking Attacks vs. Content Safety Filters: How Far Are We in the LLM Safety Arms Race?
Yuan Xin, Dingfan Chen, Linyi Yang +2
As large language models (LLMs) are increasingly deployed, ensuring their safe use is paramount. Jailbreaking, adversarial prompts that bypass model alignment to trigger harmful ou…
cs.LG2025
Provably Cost-Sensitive Adversarial Defense via Randomized Smoothing
Yuan Xin, Dingfan Chen, Michael Backes +1
As ML models are increasingly deployed in critical applications, robustness against adversarial perturbations is crucial. While numerous defenses have been proposed to counter such…