1 paper
Hiroshi Tanaka, Anika Rao, Hana Satou +2
Multimodal Large Models (MLLMs) have achieved remarkable progress in vision-language understanding and generation tasks. However, existing MLLMs typically rely on static modality f…