2 papers
cs.LG2026
PREFINE: Preference-Based Implicit Reward and Cost Fine-Tuning for Safety Alignment
Richa Verma, Bavish Kulur, Sanjay Chawla +1
We address the problem of making a pre-trained reinforcement learning (RL) policy safety-aware by incorporating cost constraints without retraining it from scratch. While costs cou…
cs.LG2025
Explaining the role of Intrinsic Dimensionality in Adversarial Training
Enes Altinisik, Safa Messaoud, Husrev Taha Sencar +2
Adversarial Training (AT) impacts different architectures in distinct ways: vision models gain robustness but face reduced generalization, encoder-based models exhibit limited robu…