1 paper
Tian Lan, Yemin Wang, Chuancheng Shi +6
Language models (LMs) often acquire various biases during pre-training and may express them in interactions, potentially causing social harm. Existing methods often rely on counter…