Showing cs.CLShow all
2 papers · 1 filter
cs.CL2026
Reward Auditor: Inference on Reward Modeling Suitability in Real-World Perturbed Scenarios
Jianxiang Zang, Yongda Wei, Ruxue Bai +5
Reliable reward models (RMs) are critical for ensuring the safe alignment of large language models (LLMs). However, current RM evaluation methods focus solely on preference percept…
cs.CL2024
On Active Privacy Auditing in Supervised Fine-tuning for White-Box Language Models
Qian Sun, Hanpeng Wu, Xi Sheryl Zhang
The pretraining and fine-tuning approach has become the leading technique for various NLP applications. However, recent studies reveal that fine-tuning data, due to their sensitive…