1 paper · 1 filter
Mozhi Zhang, Mianqiu Huang, Rundong Shi +5
Large language models optimized with techniques like RLHF have achieved good alignment in being helpful and harmless. However, post-alignment, these language models often exhibit o…