activity
20242026
collaborators

11 papers

cs.CV2026

Last But Not Least: Boundary Attention CalibratiON for Multimodal KV Cache Compression

Tianhao Chen, Yuheng Wu, Kelu Yao +3

Multimodal Large Language Models (MLLMs) achieve strong vision-language reasoning, but long visual contexts enlarge the KV cache and increase decoding latency. Existing compression…

cs.AI2026

The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook

Xinlei Yu, Zhangquan Chen, Yongbo He +36

Latent space is rapidly emerging as a native substrate for language-based models. While modern systems are still commonly understood through explicit token-level generation, an inc…

cs.CV2026

AHPA: Adaptive Hierarchical Prior Alignment for Diffusion Transformers

Ruibin Min, Yexin Liu, Aimin Pan +5

Representation alignment has recently emerged as an effective paradigm for accelerating Diffusion Transformer training. Despite their success, existing alignment methods typically…

cs.CV2026

PhysRVG: Physics-Aware Unified Reinforcement Learning for Video Generative Models

Qiyuan Zhang, Biao Gong, Shuai Tan +7

Physical principles are fundamental to realistic visual simulation, but remain a significant oversight in transformer-based video generation. This gap highlights a critical limitat…

cs.CV2025

Asymmetric Cross-Modal Knowledge Distillation: Bridging Modalities with Weak Semantic Consistency

Riling Wei, Kelu Yao, Chuanguang Yang +3

Cross-modal Knowledge Distillation has demonstrated promising performance on paired modalities with strong semantic connections, referred to as Symmetric Cross-modal Knowledge Dist…

cs.CV2025

Falcon: A Remote Sensing Vision-Language Foundation Model (Technical Report)

Kelu Yao, Nuo Xu, Rong Yang +8

This paper introduces a holistic vision-language foundation model tailored for remote sensing, named Falcon. Falcon offers a unified, prompt-based paradigm that effectively execute…