2 papers
cs.CR2026
Refusal is Not Safety! Benchmarking Latent Safety Risks of LLM-Driven Content Humorization
Yu Cui, Ruiqing Yue, Tingyu Li +6
Safety defenses for large language models (LLMs) have been extensively studied, with existing approaches focusing on attack detection and refusal mechanisms. Such fixed-form direct…
cs.CR2025
Towards Provably Secure Generative AI: Reliable Consensus Sampling
Yu Cui, Hang Fu, Sicheng Pan +9
Existing research on generative AI security is primarily driven by mutually reinforcing attack and defense methodologies grounded in empirical experience. This dynamic frequently g…