1 paper
Jubayer Ibn Hamid, Ifdita Hasan Orney, Ellen Xu +2
Reinforcement learning fine-tuning (RLFT) is a dominant paradigm for improving pretrained policies for downstream tasks. These pretrained policies, trained on large datasets, produ…