2 papers
cs.CL2026
Rewarding Reasoning, Not Answers: Fixing and Bounding Test-Time Reinforcement Learning on Medical QA
Kailong Fan, Anqi Pu, Yichen Wu +7
Test-time reinforcement learning adapts a model on its own unlabeled test set using majority-vote pseudo-labels and has shown strong results in mathematics. We show that this recip…
cs.LG2026
MAPLE: Elevating Medical Reasoning from Statistical Consensus to Process-Led Alignment
Kailong Fan, Anqi Pu, Yichen Wu +7
Recent advances in medical large language models have explored Test-Time Reinforcement Learning (TTRL) to enhance reasoning. However, standard TTRL often relies on majority voting…