3 citations · 3 across the 8 of their papers we have counts for
9 papers · 1 filter
UniDiffFusion: A Unified Diffusion Framework for Multi-Task and Degradation-Robust Image Fusion
Xingxin Xu, Siqi Zhao, Xin Li +3
General image fusion aims to integrate complementary information from multiple source images, but existing methods often rely on task-specific models and struggle to maintain robus…
DynCur-Geo: Dynamic Curiosity Reward Shaping for Multimodal Active Geo-Localization
Yiming Sun, Yang Zhang, Pengfei Zhu
Active geo-localization enables low-altitude UAVs to search for specified targets from limited local aerial observations, supporting time-sensitive applications such as search and…
Rethinking Air-Ground Collaboration: A Progressive Cross-Task Benchmark and Socialized Learning Framework
Zhoupeng Guo, Yunqi Zhu, Zhihe Fan +6
Air-ground collaborative perception is crucial for robust visual understanding in real-world dynamic environments. However, existing studies typically formulate collaboration as si…
CtrlFuse: Mask-Prompt Guided Controllable Infrared and Visible Image Fusion
Yiming Sun, Yuan Ruan, Qinghua Hu +1
Infrared and visible image fusion generates all-weather perception-capable images by combining complementary modalities, enhancing environmental awareness for intelligent unmanned…
DIFF-MF: A Difference-Driven Channel-Spatial State Space Model for Multi-Modal Image Fusion
Yiming Sun, Zifan Ye, Qinghua Hu +1
Multi-modal image fusion aims to integrate complementary information from multiple source images to produce high-quality fused images with enriched content. Although existing appro…
SmartSight: Mitigating Hallucination in Video-LLMs Without Compromising Video Understanding via Temporal Attention Collapse
Yiming Sun, Mi Zhang, Feifei Li +2
Despite Video Large Language Models having rapidly advanced in recent years, perceptual hallucinations pose a substantial safety risk, which severely restricts their real-world app…