most citedFrom Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models

2 citations

Showing cs.CVShow all

5 papers · 1 filter

cs.CV2026

Unleashing the Power of Text: Text-Guided Flow Matching for Image Fusion under Complex Degradations

Axi Niu, Jieheng Li, Kang Zhang +3

Infrared-visible image fusion under realistic degradation scenarios is a challenging task, as degradations not only cause a loss of reliable modality-specific information in observ…

cs.CV2026

SafeBuild-Bench: A Temporal-Robust Construction Safety Benchmark with Graph-Enhanced Data Mining

Yi Cui, Zilin Wang, Yijie Xu +5

Construction-safety models must handle concrete deployment risks, such as a worker standing near a scaffold edge without guardrails, rather than only recognize common objects in cu…

cs.CV2026

Image-Conditioned Instance Prompt Network for Referring Remote Sensing Image Segmentation

Biaoyu Ren, Qingsheng Wang, Cun Xu +2

Referring Remote Sensing Image Segmentation (RRSIS) is a situated, task-driven cross-modal task related to the embodied perception paradigm, requiring models to align visual-spatia…

cs.CV2026

VGGT-CD: Training-Free Robust Registration for 3D Change Detection

Wei Zhang, Songhua Li, Yihang Wu +2

3D change detection from multi-view images is essential for urban monitoring, disaster assessment, and autonomous driving. However, existing methods predominantly operate in the 2D…

cs.CV2026

A cross-modal network for facial expression recognition

Chunwei Tian, Jingyuan Xie, Qi Zhang +3

Deep neural networks enriched with structural information have been widely employed for facial expression recognition tasks. However, these methods often depend on hierarchical inf…