Showing cs.LGShow all
2 papers · 1 filter
cs.LG2025
Detecting Instruction Fine-tuning Attacks using Influence Function
Jiawei Li
Instruction fine-tuning attacks pose a serious threat to large language models (LLMs) by subtly embedding poisoned examples in fine-tuning datasets, leading to harmful or unintende…
cs.LG2024
Enhancing Out-of-Distribution Detection with Multitesting-based Layer-wise Feature Fusion
Jiawei Li, Sitong Li, Shanshan Wang +3
Deploying machine learning in open environments presents the challenge of encountering diverse test inputs that differ significantly from the training data. These out-of-distributi…