2 papers
cs.CV2025
Learning to Fuse: Modality-Aware Adaptive Scheduling for Robust Multimodal Foundation Models
Liam Bennett, Mason Clark, Lucas Anderson +2
Multimodal foundation models have achieved impressive progress across a wide range of vision-language tasks. However, existing approaches often adopt fixed or task-specific fusion…
cs.CV2025
Dynamic Modality Scheduling for Multimodal Large Models via Confidence, Uncertainty, and Semantic Consistency
Hiroshi Tanaka, Anika Rao, Hana Satou +2
Multimodal Large Models (MLLMs) have achieved remarkable progress in vision-language understanding and generation tasks. However, existing MLLMs typically rely on static modality f…