1 paper
Jang Hyun Cho, Boris Ivanovic, Yulong Cao +8
Multi-modal large language models (MLLMs) have shown incredible capabilities in a variety of 2D vision and language tasks. We extend MLLMs' perceptual capabilities to ground and re…