1 paper · 1 filter
Dongyoon Hwang, Hojoon Lee, Jaegul Choo +2
While reinforcement learning (RL) for large language models (LLMs) has shown promise in mathematical reasoning, strategic reasoning for LLMs using RL remains largely unexplored. We…