1 paper · 1 filter
Jiaming Ji, Donghai Hong, Borong Zhang +10
In this study, we introduce the safety human preference dataset, PKU-SafeRLHF, designed to promote research on safety alignment in large language models (LLMs). As a sibling projec…