1 paper
Partha Pratim Saha, Samarth Raina, Mayur Parvatikar +4
Preference alignment has substantially improved the observable behavior of large language models, yet it remains unclear what alignment changes internally. Aligned systems still fa…