1 paper · 1 filter
Yu Qiao, Phuong-Nam Tran, Ji Su Yoon +4
Reinforcement learning (RL)-based large language models (LLMs), such as ChatGPT, DeepSeek, and Grok-3, have attracted widespread attention for their remarkable capabilities in mult…