3 papers
cs.CV2026
AttriStory: Fine-grained Attribute Realization for Visual Storytelling with Diffusion Models
Manogna Sreenivas, Rohit Kumar, Soma Biswas
Visual storytelling with diffusion models has made impressive strides in maintaining character consistency across narrative scenes. However, a critical gap remains: while these met…
cs.CV2025
Multiple Stochastic Prompt Tuning for Few-shot Adaptation under Extreme Domain Shift
Debarshi Brahma, Soma Biswas
Foundation Vision-Language Models (VLMs) like CLIP exhibit strong generalization capabilities due to large-scale pretraining on diverse image-text pairs. However, their performance…
cs.CV2025
Prompt Tuning Vision Language Models with Margin Regularizer for Few-Shot Learning under Distribution Shifts
Debarshi Brahma, Anuska Roy, Soma Biswas
Recently, Vision-Language foundation models like CLIP and ALIGN, which are pre-trained on large-scale data have shown remarkable zero-shot generalization to diverse datasets with d…