3 papers
cs.CV2025
Efficient Few-Shot Continual Learning in Vision-Language Models
Aristeidis Panos, Rahaf Aljundi, Daniel Olmeda Reino +1
Vision-language models (VLMs) excel in tasks such as visual question answering and image captioning. However, VLMs are often limited by their use of pretrained image encoders, like…
stat.ML2024
Decomposable Transformer Point Processes
Aristeidis Panos
The standard paradigm of modeling marked point processes is by parameterizing the intensity function using an attention-based (Transformer-style) architecture. Despite the flexibil…
cs.CV2024
Imperfect Vision Encoders: Efficient and Robust Tuning for Vision-Language Models
Aristeidis Panos, Rahaf Aljundi, Daniel Olmeda Reino +1
Vision language models (VLMs) demonstrate impressive capabilities in visual question answering and image captioning, acting as a crucial link between visual and language models. Ho…