Showing cs.CVShow all
2 papers · 1 filter
cs.CV2026
SPARK: Representation-Level KV Memory Alignment for Safer Vision-Language Models
Mohd Azfar, Izhar Dad Khan
Vision-language models (VLMs) remain vulnerable to jailbreaks that distribute harmful intent across text and images, making unimodal safety mechanisms insufficient. We investigate…
cs.CV2024
Adaptive Multi Scale Document Binarisation Using Vision Mamba
Mohd. Azfar, Siddhant Bharadwaj, Ashwin Sasikumar
Enhancing and preserving the readability of document images, particularly historical ones, is crucial for effective document image analysis. Numerous models have been proposed for…