1 paper · 1 filter
Deng Yixuan, Ji Xiaoqiang
Large Language Models (LLMs) often exhibit implicit biases and discriminatory tendencies that reflect underlying social stereotypes. While recent alignment techniques such as RLHF…