Showing cs.AIShow all
2 papers · 1 filter
cs.AI2026
TRACE: An Evidence-Grounded Benchmark for Safety Evaluation of Large Reasoning Models
Zhenyu Wu, Siyuan Chen, Changchun Yang +8
Large Reasoning Models (LRMs) generate intermediate reasoning traces that may contain unsafe content, even when their final responses appear safe. Guardrail models are designed to…
cs.AI2025
SafeRBench: Dissecting the Reasoning Safety of Large Language Models
Xin Gao, Shaohan Yu, Zerui Chen +8
Large Reasoning Models (LRMs) have significantly improved problem-solving through explicit Chain-of-Thought (CoT) reasoning. However, this capability creates a Safety-Helpfulness P…