3 papers
cs.LG2025
LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning
Gabriel J. Perin, Runjin Chen, Xuxi Chen +3
Large Language Models (LLMs) have become indispensable in real-world applications. However, their widespread adoption raises significant safety concerns, particularly in responding…
cs.AI2025
More is Less: The Pitfalls of Multi-Model Synthetic Preference Data in DPO Safety Alignment
Yifan Wang, Runjin Chen, Bolian Li +7
Aligning large language models (LLMs) with human values is an increasingly critical step in post-training. Direct Preference Optimization (DPO) has emerged as a simple, yet effecti…
cs.LG2024
Enhancing Item Tokenization for Generative Recommendation through Self-Improvement
Runjin Chen, Mingxuan Ju, Ngoc Bui +7
Generative recommendation systems, driven by large language models (LLMs), present an innovative approach to predicting user preferences by modeling items as token sequences and ge…