4 papers · 1 filter
MAGIC: Multimodal Alignment & Grounding-aware Instruction Coreset for Vision-Language Models
Shristi Das Biswas, Kaushik Roy
Instruction tuning of large vision-language models (LVLMs) increasingly depends on massive multimodal corpora, yet these datasets contain samples with substantial redundancy, low v…
HEART: Hyperspherical Embedding Alignment via Kent-Representation Traversal in Diffusion Models
Arani Roy, Shristi Das Biswas, Kaushik Roy
Text-to-image diffusion models can generate visually stunning images, yet, controlling what appears and how it appears, remains surprisingly difficult, especially when operating so…
Now You See It, Now You Don't - Instant Concept Erasure for Safe Text-to-Image and Video Generation
Shristi Das Biswas, Arani Roy, Kaushik Roy
Robust concept removal for text-to-image (T2I) and text-to-video (T2V) models is essential for their safe deployment. Existing methods, however, suffer from costly retraining, infe…
CURE: Concept Unlearning via Orthogonal Representation Editing in Diffusion Models
Shristi Das Biswas, Arani Roy, Kaushik Roy
As Text-to-Image models continue to evolve, so does the risk of generating unsafe, copyrighted, or privacy-violating content. Existing safety interventions - ranging from training…