1 paper · 1 filter
Charles L. Wang, Keir Dorchen, Peter Jin
Contemporary AI safety spans pre-training interventions, post-training alignment, deployment-time controls, monitoring, and red-teaming. These methods are necessary, but they prima…