1 paper · 1 filter
Xixiang He, Xingming Li, Baiqi Wu +4
Modern large language models (LLMs) rely on reinforcement learning to build strong capabilities in individual domains, but integrating those capabilities into a single deployable m…