1 paper · 1 filter
Suyash Maniyar, Armaan Sandhu, Abhishek Mishra
When a reward is correct on every training example yet consistent with more than one goal, a model can acquire an unintended one, a failure known as goal misgeneralization. Endpoin…