1 paper
Carter Adams, Rafael Oliveira, Gabriel Almeida +1
Reinforcement fine-tuning with verifiable rewards (RLVR) has emerged as a powerful paradigm for equipping large vision-language models (LVLMs) with agentic capabilities such as too…