1 paper
Muhammad Zain Amin, Kibele Sebnem Yildirim
Reinforcement Learning is commonly used to train large language models using environmental feedback. In applied settings, the environment usually provides sparse or delayed feedbac…