1 paper
Kailong Fan, Anqi Pu, Yichen Wu +7
Recent advances in medical large language models have explored Test-Time Reinforcement Learning (TTRL) to enhance reasoning. However, standard TTRL often relies on majority voting…