2 papers
cs.CL2025
Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models
Yang Zhang, Yu Yu, Bo Tang +8
With the rapid development of Large Language Models (LLMs), aligning these models with human preferences and values is critical to ensuring ethical and safe applications. However,…
cs.LG2025
Adversarial Preference Learning for Robust LLM Alignment
Yuanfu Wang, Pengyu Wang, Chenyang Xi +13
Modern language models often rely on Reinforcement Learning from Human Feedback (RLHF) to encourage safe behaviors. However, they remain vulnerable to adversarial attacks due to th…