1 paper
Chengxuan Lu, Zhenquan Zhang, Shukuan Wang +3
Post-training with reinforcement learning (RL) has recently shown strong promise for advancing multimodal agents beyond supervised imitation. However, RL remains limited by poor da…