1 paper · 2 filters
Yiming Zhang, Zhuokai Zhao, Chengzhang Yu +8
Autoregressive large vision--language models (LVLMs) interface video and language by projecting video features into the LLM's embedding space as continuous visual token embeddings.…