6 papers
Test-Time Hallucination Control in Large Vision-Language Models
Mehran Tamjidi, Hamidreza Dastmalchi, Ali Cheraghian +3
Object Hallucination in large vision-language models (LVLMs), where models generate non-factual content about input images, remains a critical barrier to their reliability in real-…
SteerSeg: Attention Steering for Reasoning Video Segmentation
Ali Cheraghian, Hamidreza Dastmalchi, Abdelwahed Khamis +3
Video reasoning segmentation requires localizing objects across video frames from natural language expressions, often involving spatial reasoning and implicit references. Recent ap…
Fighting Hallucinations with Counterfactuals: Diffusion-Guided Perturbations for LVLM Hallucination Suppression
Hamidreza Dastmalchi, Aijun An, Ali Cheraghian +1
While large vision-language models (LVLMs) achieve strong performance on multimodal tasks, they frequently generate hallucinations -- unfaithful outputs misaligned with the visual…
Adapt-As-You-Walk Through the Clouds: Training-Free Online Test-Time Adaptation of 3D Vision-Language Foundation Models
Mehran Tamjidi, Hamidreza Dastmalchi, Mohammadreza Alimoradijazi +3
3D Vision-Language Foundation Models (VLFMs) have shown strong generalization and zero-shot recognition capabilities in open-world point cloud processing tasks. However, these mode…
ETTA: Efficient Test-Time Adaptation for Vision-Language Models through Dynamic Embedding Updates
Hamidreza Dastmalchi, Aijun An, Ali cheraghian
Pretrained vision-language models (VLMs) like CLIP show strong zero-shot performance but struggle with generalization under distribution shifts. Test-Time Adaptation (TTA) addresse…
Test-Time Adaptation of 3D Point Clouds via Denoising Diffusion Models
Hamidreza Dastmalchi, Aijun An, Ali Cheraghian +2
Test-time adaptation (TTA) of 3D point clouds is crucial for mitigating discrepancies between training and testing samples in real-world scenarios, particularly when handling corru…