1 paper
Reem I. Masoud, Martin Ferianc, Philip Treleaven +1
Large Language Model (LLM) alignment conventionally relies on supervised fine-tuning or reinforcement learning based alignment frameworks. These methods typically require labeled o…