1 paper
Liam Bennett, Mason Clark, Lucas Anderson +2
Multimodal foundation models have achieved impressive progress across a wide range of vision-language tasks. However, existing approaches often adopt fixed or task-specific fusion…