2 papers
cs.LG2025
A Granular Study of Safety Pretraining under Model Abliteration
Shashank Agnihotri, Jonas Jakubassa, Priyam Dey +4
Open-weight LLMs can be modified at inference time with simple activation edits, which raises a practical question for safety: do common safety interventions like refusal training…
cs.CV2025
SemSegBench & DetecBench: Benchmarking Reliability and Generalization Beyond Classification
Shashank Agnihotri, David Schader, Jonas Jakubassa +5
Reliability and generalization in deep learning are predominantly studied in the context of image classification. Yet, real-world applications in safety-critical domains involve a…