1 paper
Huyen T. T. Tran, Van-Quang Nguyen, Farros Alferro +2
Multimodal Large Language Models (MLLMs) have shown impressive abilities in understanding and reasoning over conventional images. However, their perception of 360° images remains l…