1 paper · 1 filter
Yanbo Wang, Minzheng Wang, Jian Liang +3
While reasoning models have achieved remarkable success in complex reasoning tasks, their increasing power necessitates stringent safety measures. For safety alignment, the core ch…