4 papers · 1 filter
From Glance to Scrutiny: Progressive Distortion Reasoning for Fine-Grained Image Quality Assessment
Aoting Zhang, Mingze Gao, Dongbao Yang +5
Multi-modal large language models (MLLMs) have demonstrated significant potential in image quality assessment (IQA) by bridging visual perception with descriptive evaluations. Howe…
Multi-Image Visual Token Pruning in Large Visual Language Models
Rongyang Zhang, Chengqiang Lu, Cong Li +9
With the growing demand for processing multiple image sequences in real-world applications, various visual token pruning methods have emerged to mitigate the computational and cont…
EditCaption: Human-Refined SFT and HAE-DPO for Image Editing Instruction Synthesis
Xiangyuan Wang, Honghao Cai, Yunhao Bai +9
High-quality source-target image pairs with precise editing instructions are essential for instruction-guided image editing, yet constructing such training triplets at scale remain…
MUSE: Resolving Manifold Misalignment in Visual Tokenization via Topological Orthogonality
Panqi Yang, Haodong Jing, Jiahao Chao +5
Unified visual tokenization faces a fundamental trade-off between high-fidelity pixel reconstruction (spatial equivariance) and semantic abstraction (conceptual invariance). We att…