1 paper · 1 filter
Weilun Xu, Alexander Rusnak, Frederic Kaplan
When large language models make ethical judgments, do their internal representations distinguish between normative frameworks, or collapse ethics into a single acceptability dimens…