1 paper · 1 filter
Qi Wang, Yanrui Yu, Ye Yuan +2
Reinforcement fine-tuning (RFT) has shown great promise in achieving humanlevel reasoning capabilities of Large Language Models (LLMs), and has recently been extended to MLLMs. Nev…