1 paper · 1 filter
Yanlin Lai, Mitt Huang, Hangyu Guo +11
Reinforcement Learning from Human Feedback (RLHF) remains indispensable for aligning large language models (LLMs) in subjective domains. To enhance robustness, recent work shifts t…