1 paper
Yupeng Ren, Jiangtao Chen, Rui Zhang
Large Language Models (LLMs) face significant security risks despite their advanced capabilities. While techniques like Reinforcement Learning with Human Feedback (RLHF) improve et…