1 paper · 1 filter
Aladin Djuhera, Swanand Ravindra Kadhe, Farhan Ahmed +3
Advances in large language models (LLMs) are driving a shift toward using reinforcement learning (RL) to train agents from iterative, multi-turn interactions across tasks. However,…