1 paper
Ben Hauptvogel, Malte Ostendorff, Georg Rehm +1
Recent advancements in large language models (LLMs) have led to their increased application across various tasks, with reinforcement learning from human feedback (RLHF) being a cru…