Showing cs.CVShow all
3 papers · 1 filter
cs.CV2026
Revealing Training Data Exposure in Vision Language Large Models via Parameter Gradients
Zhihao Zhu, Hongyi Tang, Yi Yang +1
Vision-Language Large Models (VLLMs) trained on massive crawled corpora raise pressing copyright and data-provenance concerns. These concerns are particularly acute in healthcare,…
cs.CV2026
A Picture is Worth a Thousand Words? An Empirical Study of Aggregation Strategies for Visual Financial Document Retrieval
Ho Hung Lim, Yi Yang
Visual RAG has offered an alternative to traditional RAG. It treats documents as images and uses vision encoders to obtain vision patch tokens. However, hundreds of patch tokens pe…
cs.CV2026
DistractMIA: Black-Box Membership Inference on Vision-Language Models via Semantic Distraction
Hongyi Tang, Zhihao Zhu, Yi Yang
Vision-language models (VLMs) are trained on large-scale image-text corpora that may contain private, copyrighted, or otherwise sensitive data, motivating membership inference as a…