3 papers
cs.LG2026
How Learning Dynamics Drive Adversarially Robust Generalization?
Yuelin Xu, Xiao Zhang
Despite being widely adopted as a canonical framework for learning robust models, adversarial training suffers from robust overfitting. Existing empirical and theoretical explorati…
cs.CR2026
GREAT: Generalizable Backdoor Attacks in RLHF via Emotion-Aware Trigger Synthesis
Subrat Kishore Dutta, Yuelin Xu, Piyush Pant +1
Recent work has shown that RLHF is highly susceptible to backdoor attacks. However, existing methods often rely on rare tokens or fixed triggers, limiting their impact in realistic…
cs.LG2026
Efficient Semi-Supervised Adversarial Training via Latent Clustering-Based Data Reduction
Somrita Ghosh, Yuelin Xu, Xiao Zhang
Learning robust models under adversarial settings is widely recognized as requiring a considerably large number of training samples. Recent work proposes semi-supervised adversaria…