4 papers
Beyond Global Editing: Per-Instance Disentangled Subspaces for Training-Free Hallucination Mitigation in LVLMs
Ali Cheraghian, Hamidreza Dastmalchi, Hamed Barzamini +4
Recent advances in large vision-language models (LVLMs) have enabled powerful multimodal reasoning by integrating visual encoders with large language models (LLMs). However, their…
SteerSeg: Attention Steering for Reasoning Video Segmentation
Ali Cheraghian, Hamidreza Dastmalchi, Abdelwahed Khamis +3
Video reasoning segmentation requires localizing objects across video frames from natural language expressions, often involving spatial reasoning and implicit references. Recent ap…
Adapt-As-You-Walk Through the Clouds: Training-Free Online Test-Time Adaptation of 3D Vision-Language Foundation Models
Mehran Tamjidi, Hamidreza Dastmalchi, Mohammadreza Alimoradijazi +3
3D Vision-Language Foundation Models (VLFMs) have shown strong generalization and zero-shot recognition capabilities in open-world point cloud processing tasks. However, these mode…
Foundation Model-Powered 3D Few-Shot Class Incremental Learning via Training-free Adaptor
Sahar Ahmadi, Ali Cheraghian, Morteza Saberi +4
Recent advances in deep learning for processing point clouds hold increased interest in Few-Shot Class Incremental Learning (FSCIL) for 3D computer vision. This paper introduces a…