1 paper · 1 filter
Hongyi James Cai, Junlin Wang, Xiaoyin Chen +1
Recent advancements in large language models (LLMs) suggest that reinforcement learning (RL) effectively internalizes search strategies, yielding significant improvements on challe…