Showing cs.CLShow all
2 papers · 1 filter
cs.CL2024
RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models
Saeed Khaki, JinJin Li, Lan Ma +2
Reinforcement learning from human feedback (RLHF) has been extensively employed to align large language models with user intent. However, proximal policy optimization (PPO) based R…
cs.CL2021
Error Detection in Large-Scale Natural Language Understanding Systems Using Transformer Models
Rakesh Chada, Pradeep Natarajan, Darshan Fofadiya +1
Large-scale conversational assistants like Alexa, Siri, Cortana and Google Assistant process every utterance using multiple models for domain, intent and named entity recognition.…