Showing cs.LGShow all
2 papers · 1 filter
cs.LG2025
Bradley-Terry and Multi-Objective Reward Modeling Are Complementary
Zhiwei Zhang, Hui Liu, Xiaomin Li +10
Reward models trained on human preference data have demonstrated strong effectiveness in aligning Large Language Models (LLMs) with human intent under the framework of Reinforcemen…
cs.LG2025
A General Framework to Enhance Fine-tuning-based LLM Unlearning
Jie Ren, Zhenwei Dai, Xianfeng Tang +7
Unlearning has been proposed to remove copyrighted and privacy-sensitive data from Large Language Models (LLMs). Existing approaches primarily rely on fine-tuning-based methods, wh…