1 paper · 1 filter
Ike Obi, Rohan Pant, Srishti Shekhar Agrawal +2
LLMs are increasingly fine-tuned using RLHF datasets to align them with human preferences and values. However, very limited research has investigated which specific human values ar…