2 papers
cs.CL2025
Robust Multi-Objective Preference Alignment with Online DPO
Raghav Gupta, Ryan Sullivan, Yunxuan Li +2
Multi-objective preference alignment of large language models (LLMs) is critical for developing AI systems that are more configurable, personalizable, helpful, and safe. However, o…
cs.LG2024
Conditional Language Policy: A General Framework for Steerable Multi-Objective Finetuning
Kaiwen Wang, Rahul Kidambi, Ryan Sullivan +17
Reward-based finetuning is crucial for aligning language policies with intended behaviors (e.g., creativity and safety). A key challenge is to develop steerable language models tha…