2 papers
cs.AI2026
From Parameter Dynamics to Risk Scoring : Quantifying Sample-Level Safety Degradation in LLM Fine-tuning
Xiao Wang, Yifei Zhang, YongKang Liu +4
Safety alignment of Large Language Models (LLMs) is extremely fragile, as fine-tuning on a small number of benign samples can erase safety behaviors learned from millions of prefer…
cs.IR2024
Unsupervised dense retrieval with conterfactual contrastive learning
Haitian Chen, Qingyao Ai, Xiao Wang +3
Efficiently retrieving a concise set of candidates from a large document corpus remains a pivotal challenge in Information Retrieval (IR). Neural retrieval models, particularly den…