1 paper
Theo Cachet, Christopher R. Dance, Olivier Sigaud
Vision-language models (VLMs) have tremendous potential for grounding language, and thus enabling language-conditioned agents (LCAs) to perform diverse tasks specified with text. T…