1 paper · 1 filter
Disen Liao, Yihan Wang, Freda Shi +1
Scaling laws are usually read as a capability story: lower language-modeling loss yields more useful models. We study a safety consequence of this mechanism in \emph{cross-session…