1 paper · 1 filter
Haobin Jiang, Zongqing Lu
Generalization is a pivotal challenge for agents following natural language instructions. To approach this goal, we leverage a vision-language model (VLM) for visual grounding and…