1 paper · 1 filter
Partha Pratim Saha, Samarth Raina, Mayur Parvatikar +4
Preference alignment has substantially improved the observable behavior of large language models, yet it remains unclear what alignment changes internally. Aligned systems still fa…