8 papers
Retrieval-Augmented Visual Prompting: Guiding Foundation Models in Two-Photon Imaging
Salvatore Calcagno, Marco Finocchiaro, Giovanni Bellitto +3
Two-photon calcium imaging presents a challenging setting for foundation models: image appearance varies substantially across recordings and experimental conditions, annotations ar…
PERL: Parameter Efficient Reasoning in CLIP Latent Space
Simone Carnemolla, Salvatore Calcagno, Daniela Giordano +2
Contrastively trained vision-language models such as CLIP provide strong zero-shot transfer by aligning images and text in a shared embedding space. However, adapting these models…
OCCAM: Open-set Causal Concept explAnation and Ontology induction for black-box vision Models
Chiara Maria Russo, Simone Carnemolla, Simone Palazzo +3
Interpreting the decisions of deep image classifiers remains challenging, particularly in black-box settings where model internals are inaccessible. We introduce OCCAM, a framework…
UNBOX: Unveiling Black-box visual models with Natural-language
Simone Carnemolla, Chiara Russo, Simone Palazzo +5
Ensuring trustworthiness in open-world visual recognition requires models that are interpretable, fair, and robust to distribution shifts. Yet modern vision systems are increasingl…
DEXTER: Diffusion-Guided EXplanations with TExtual Reasoning for Vision Models
Simone Carnemolla, Matteo Pennisi, Sarinda Samarasinghe +5
Understanding and explaining the behavior of machine learning models is essential for building transparent and trustworthy AI systems. We introduce DEXTER, a data-free framework th…
SeeingSounds: Learning Audio-to-Visual Alignment via Text
Simone Carnemolla, Matteo Pennisi, Chiara Russo +3
We introduce SeeingSounds, a lightweight and modular framework for audio-to-image generation that leverages the interplay between audio, language, and vision-without requiring any…