1 paper · 1 filter
Boyu Li, Haobin Jiang, Ziluo Ding +4
Recently, multimodal large language models (MLLMs) have demonstrated strong visual understanding and decision-making capabilities, enabling the exploration of autonomously improvin…