Showing cs.AIShow all
2 papers · 1 filter
cs.AI2025
Reward Model Routing in Alignment
Xinle Wu, Yao Lu
Reinforcement learning from human or AI feedback (RLHF / RLAIF) has become the standard paradigm for aligning large language models (LLMs). However, most pipelines rely on a single…
cs.AI2025
Collaborative Editable Model
Kaiwen Tang, Aitong Wu, Yao Lu +1
Vertical-domain large language models (LLMs) play a crucial role in specialized scenarios such as finance, healthcare, and law; however, their training often relies on large-scale…