1 paper
Lobna Joualy, Eric Demeester, Nikolaos Tsiogkas
Vision-language models (VLMs) can replace human annotators in preference-based reward learning, but sequential API requests and single-environment data collection make training slo…