4 papers
MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts
Wenqi Marshall Guo, Qingyun Qian, Shiyu Zhou +2
Vision Language Models (VLMs) are well known for hallucinating non-existent objects in images. Objects with missing parts present a unique challenge for VLMs, stemming from both re…
Position: Universal Aesthetic Alignment Narrows Artistic Expression
Wenqi Marshall Guo, Qingyun Qian, Khalad Hasan +1
Over-aligning image generation models to a generalized aesthetic preference conflicts with user intent, particularly when "anti-aesthetic" outputs are requested for artistic or cri…
MMTok: Multimodal Coverage Maximization for Efficient Inference of VLMs
Sixun Dong, Juhua Hu, Mian Zhang +3
Vision-Language Models (VLMs) demonstrate impressive performance in understanding visual content with language instruction by converting visual inputs to vision tokens. However, re…
Customized Multiple Clustering via Multi-Modal Subspace Proxy Learning
Jiawei Yao, Qi Qian, Juhua Hu
Multiple clustering aims to discover various latent structures of data from different aspects. Deep multiple clustering methods have achieved remarkable performance by exploiting c…