6 citations · 11 across the 6 of their papers we have counts for
3 papers · 1 filter
Visual Memory Injection Attacks for Multi-Turn Conversations
Christian Schlarmann, Matthias Hein
Generative large vision-language models (LVLMs) have recently achieved impressive performance gains, and their user base is growing rapidly. However, the security of LVLMs, in part…
FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens
Christian Schlarmann, Francesco Croce, Nicolas Flammarion +1
Contrastive language-image pre-training aligns features of text-image pairs in a common latent space via distinct encoders for each modality. While this approach achieves impressiv…
Adversarially Robust CLIP Models Can Induce Better (Robust) Perceptual Metrics
Francesco Croce, Christian Schlarmann, Naman Deep Singh +1
Measuring perceptual similarity is a key tool in computer vision. In recent years perceptual metrics based on features extracted from neural networks with large and diverse trainin…