Showing cs.CRShow all
2 papers · 1 filter
cs.CR2025
Deep Research Brings Deeper Harm
Shuo Chen, Zonggen Li, Zhen Han +7
Deep Research (DR) agents built on Large Language Models (LLMs) can perform complex, multi-step research by decomposing tasks, retrieving online information, and synthesizing detai…
cs.CR2025
Bag of Tricks for Subverting Reasoning-based Safety Guardrails
Shuo Chen, Zhen Han, Haokun Chen +6
Recent reasoning-based safety guardrails for Large Reasoning Models (LRMs), such as deliberative alignment, have shown strong defense against jailbreak attacks. By leveraging LRMs'…