10 papers
Co-Learning for Missing Arbitrary Modalities in Multi-modal Classification
Francisco Mena, Dino Ienco, Roberto Interdonato +2
Multi-modal classification leverages complementary information across diverse data sources to enhance predictive performance. However, real-world scenarios subject to operational c…
RAMEN: Resolution-Adjustable Multimodal Encoder for Earth Observation
Nicolas Houdré, Diego Marcos, Hugo Riffaud de Turckheim +4
Earth observation (EO) data spans a wide range of spatial, spectral, and temporal resolutions, from high-resolution optical imagery to low resolution multispectral products or rada…
Metonymy in vision models undermines attention-based interpretability
Ananthu Aniraj, Cassio F. Dantas, Dino Ienco +2
Part-based reasoning is a classical strategy to make a computer vision model directly focus on the object parts that are relevant to the downstream task. In the context of deep lea…
Two-stage Vision Transformers and Hard Masking offer Robust Object Representations
Ananthu Aniraj, Cassio F. Dantas, Dino Ienco +1
Context can strongly affect object representations, sometimes leading to undesired biases, particularly when objects appear in out-of-distribution backgrounds at inference. At the…
TimeSenCLIP: A Time Series Vision-Language Model for Remote Sensing
Pallavi Jain, Diego Marcos, Dino Ienco +2
Vision-language models (VLMs) have shown significant promise in remote sensing applications, particularly for land-use and land-cover (LULC) mapping via zero-shot classification an…
Multi-modal Co-learning for Earth Observation: Enhancing single-modality models via modality collaboration
Francisco Mena, Dino Ienco, Cassio F. Dantas +2
Multi-modal co-learning is emerging as an effective paradigm in machine learning, enabling models to collaboratively learn from different modalities to enhance single-modality pred…