3 papers
cs.CV2026
SGPDFuse: Semantically-Guided Physics-Disentanglement General Multi-Modal Image Fusion
Haozhen Wei, Chengjun Jiang, Yutong Guo +4
Multimodal image fusion (MMIF) aims to integrate complementary sensor data into a single representation that preserves intrinsic scene reality while eliminating environmental inter…
cs.CV2026
LAST: The Last Query Token Guides Visual Token Pruning for Edge-Cloud Collaborative MLLM Inference
Feng Yang, Xinrui Ju, Keyang Zhang +6
Multimodal foundation models are reshaping edge-cloud visual intelligence from task-specific feature pipelines into token-based interfaces, where edge devices encode visual inputs…
cs.CV2025
Sparse2Dense: A Keypoint-driven Generative Framework for Human Video Compression and Vertex Prediction
Bolin Chen, Ru-Ling Liao, Yan Ye +5
For bandwidth-constrained multimedia applications, simultaneously achieving ultra-low bitrate human video compression and accurate vertex prediction remains a critical challenge, a…