3 papers
cs.CV2026
Unlocking Few-Shot Capabilities in LVLMs via Prompt Conditioning and Head Selection
Adhemar de Senneville, Xavier Bou, Jérémy Anger +2
Current Large Vision Language Models (LVLMs) excel at many zero-shot tasks like image captioning, visual question answering and OCR. However, these same models suffer from poor per…
eess.IV2026
Comparative analysis of dual-form networks for live land monitoring using multi-modal satellite image time series
Iris Dumeur, Jérémy Anger, Gabriele Facciolo
Multi-modal Satellite Image Time Series (SITS) analysis faces significant computational challenges for live land monitoring applications. While Transformer architectures excel at c…
cs.CV2025
Normalized vs Diplomatic Annotation: A Case Study of Automatic Information Extraction from Handwritten Uruguayan Birth Certificates
Natalia Bottaioli, Solène Tarride, Jérémy Anger +8
This study evaluates the recently proposed Document Attention Network (DAN) for extracting key-value information from Uruguayan birth certificates, handwritten in Spanish. We inves…