1 paper · 1 filter
Medha Kumar, Zifei Xu, Xin Wang +1
Strong reasoning capabilities can now be achieved by large-scale reinforcement learning (RL) without any supervised fine-tuning. Although post-training quantization (PTQ) and quant…