1 paper · 1 filter
Rishabh Kabra, Loic Matthey, Alexander Lerchner +1
Pretrained vision language models (VLMs) present an opportunity to caption unlabeled 3D objects at scale. The leading approach to summarize VLM descriptions from different views of…