3 papers
cs.CR2026
HiveTraceGuard-Pro: A Compact Generative Guardrail for Prompt Injection, Jailbreaks, and Adversarial Obfuscation
Nikita Oblakov, Sabrina Sadiekh, Evgeniy Kokuykin
Production LLMs must handle inputs that attempt to override system instructions, bypass safety policies or elicit harmful responses. A common mitigation is a separate guardrail mod…
cs.CR2026
GLiNER Guard: Unified Encoder Family for Production LLM Safety and Privacy
Bogdan Minko, Sabrina Sadiekh, Evgeniy Kokuykin
Production LLM systems require both safety moderation and PII detection under strict latency and cost constraints. This creates a trade-off: autoregressive moderators are accurate…
cs.CL2026
Cross-Lingual Jailbreak Detection via Semantic Codebooks
Shirin Alanova, Bogdan Minko, Sabrina Sadiekh +1
Safety mechanisms for large language models (LLMs) remain predominantly English-centric, creating systematic vulnerabilities in multilingual deployment. Prior work shows that trans…