3 papers
cs.CL2026
The Heterogeneous Safety Impacts of Benign Multilingual Fine-Tuning
Will Hawkins, Kaivalya Rawal, Jonathan Rystrøm +8
Fine-tuning a large language model is a ubiquitous method for enhancing its capability on a specific downstream task. However, prior work has shown that this increase in capability…
cs.LG2026
Toward Calibrated, Fair, and accurate Deepfake Detection
Ryan Brown, Chris Russell
Deepfake detectors show large performance gaps across demographic groups. Existing fairness approaches require demographic labels, retraining, or sacrifice accuracy. We introduce F…
cs.CL2026
Task-Specific Knowledge Distillation via Intermediate Probes
Ryan Brown, Chris Russell
Knowledge distillation from large language models (LLMs) assumes that the teacher's output distribution is a high-quality training signal. On reasoning tasks, this assumption is fr…