11 papers
Knowledge-Guided 3D CT Generation: A Conditioning-Centric Taxonomy
Francesca Pia Panaccione, Eugenio Lomurno, Matteo Matteucci
Controllable generation guided by external knowledge is a key requirement in modern generative deep learning applications, enabling the synthesis of samples with explicit constrain…
Synesthesia via Direct Latent Augmentation:Bypassing the Decode-Encode Loop for Cross-Modal Distillation
Cristian Sbrolli, Nicolas Michel, Matteo Matteucci +1
While multimodal integration significantly improves computer vision models, deploying them incurs prohibitive inference costs and requires scarce, perfectly paired datasets. Recent…
Evidence-Based Text-Conditioned 3D CT Synthesis for Ovarian Cancer
Francesca Pia Panaccione, Eugenio Lomurno, Francesca Fati +11
Ovarian cancer is frequently diagnosed at an advanced stage, making preoperative contrast-enhanced computed tomography (CT) central to staging and surgical planning; yet the scarci…
Auto-Comp: An Automated Pipeline for Scalable Compositional Probing of Contrastive Vision-Language Models
Cristian Sbrolli, Matteo Matteucci, Toshihiko Yamasaki
Modern Vision-Language Models (VLMs) exhibit a critical flaw in compositional reasoning, often confusing "a red cube and a blue sphere" with "a blue cube and a red sphere". Disenta…
PolyGen: Fully Synthetic Vision-Language Training via Multi-Generator Ensembles
Leonardo Brusini, Cristian Sbrolli, Eugenio Lomurno +2
Synthetic data offers a scalable solution for vision-language pre-training, yet current state-of-the-art methods typically rely on scaling up a single generative backbone, which in…
Trust in Vision-Language Models: Insights from a Participatory User Workshop
Agnese Chiatti, Lara Piccolo, Sara Bernardini +2
With the growing deployment of Vision-Language Models (VLMs), pre-trained on large image-text and video-text datasets, it is critical to equip users with the tools to discern when…