3 citations · 3 across the 11 of their papers we have counts for
20 papers · 1 filter
RGBX-R1: Visual Modality Chain-of-Thought Guided Reinforcement Learning for Multimodal Grounding
Jiahe Wu, Bing Cao, Qilong Wang +3
Multimodal Large Language Models (MLLM) are primarily pre-trained on the RGB modality, thereby limiting their performance on other modalities, such as infrared, depth, and event da…
Reversible Efficient Diffusion for Image Fusion
Xingxin Xu, Bing Cao, DongDong Li +2
Multi-modal image fusion aims to consolidate complementary information from diverse source images into a unified representation. The fused image is expected to preserve fine detail…
Generalized Few-Shot Out-of-Distribution Detection
Pinxuan Li, Bing Cao, Changqing Zhang +1
Few-shot Out-of-Distribution (OOD) detection has emerged as a critical research direction in machine learning for practical deployment. Most existing Few-shot OOD detection methods…
Hyperbolic Cycle Alignment for Infrared-Visible Image Fusion
Timing Li, Bing Cao, Jiahe Feng +3
Image fusion synthesizes complementary information from multiple sources, mitigating the inherent limitations of unimodal imaging systems. Accurate image registration is essential…
Bi-directional Self-Registration for Misaligned Infrared-Visible Image Fusion
Timing Li, Bing Cao, Pengfei Zhu +2
Acquiring accurately aligned multi-modal image pairs is fundamental for achieving high-quality multi-modal image fusion. To address the lack of ground truth in current multi-modal…
Dig2DIG: Dig into Diffusion Information Gains for Image Fusion
Bing Cao, Baoshuo Cai, Changqing Zhang +1
Image fusion integrates complementary information from multi-source images to generate more informative results. Recently, the diffusion model, which demonstrates unprecedented gen…