1 paper
Diogo Cruz, Edoardo Pona, Alex Holness-Tofts +4
Many capable large language models (LLMs) are developed via self-supervised pre-training followed by a reinforcement-learning fine-tuning phase, often based on human or AI feedback…