1 paper
Pyrros Koussios, Chenhao Li, Xin Chen +1
Designing effective reward functions remains a major bottleneck in Reinforcement Learning (RL). Recent work uses large foundation Vision-Language Models (VLMs) as reward models, co…