1 paper · 1 filter
Kapil Wanaskar, Gaytri Jena, Vinija Jain +2
Alignment in large language models (LLMs) is still largely static: after training, the policy is frozen. DPO, GRPO methods typically imprint one behavior into the weights, leaving…