1 paper · 1 filter
Hiroki Fukui
Alignment safety research assumes that ethical instructions improve model behavior, but how language models internally process such instructions remains unknown. We conducted over…