2 papers
cs.AI2026
Multimodal Function Vectors for Visual Relations
Shuhao Fu, Esther Goldberg, Ying Nian Wu +1
Large Multimodal Models (LMMs) demonstrate impressive in-context learning abilities from few multimodal demonstrations, yet the internal mechanisms supporting such task learning re…
cs.CV2025
Evaluating Compositional Scene Understanding in Multimodal Generative Models
Shuhao Fu, Andrew Jun Lee, Anna Wang +4
The visual world is fundamentally compositional. Visual scenes are defined by the composition of objects and their relations. Hence, it is essential for computer vision systems to…