Showing cs.CVShow all
2 papers · 1 filter
cs.CV2026
Instance-level Visual Active Tracking with Occlusion-Aware Planning
Haowei Sun, Kai Zhou, Hao Gao +5
Visual Active Tracking (VAT) aims to control cameras to follow a target in 3D space, which is critical for applications like drone navigation and security surveillance. However, it…
cs.CV2024
Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion
Zhuokun Chen, Jinwu Hu, Zeshuai Deng +3
Multimodal LLMs (MLLMs) equip language models with visual capabilities by aligning vision encoders with language models. Existing methods to enhance the visual perception of MLLMs…