1 paper · 1 filter
Jun-Tao Tang, Zhen-Hao Xie, Yu-Cheng Shi +1
Multimodal Large Language Models (MLLMs) unify heterogeneous vision-language tasks under a shared generative framework via instruction tuning, yet real-world deployment demands con…