1 paper
Mozhi Zhang, Mianqiu Huang, Rundong Shi +5
Large language models optimized with techniques like RLHF have achieved good alignment in being helpful and harmless. However, post-alignment, these language models often exhibit o…