3 papers
cs.RO2025
LITE: A Learning-Integrated Topological Explorer for Multi-Floor Indoor Environments
Junhao Chen, Zhen Zhang, Chengrui Zhu +4
This work focuses on multi-floor indoor exploration, which remains an open area of research. Compared to traditional methods, recent learning-based explorers have demonstrated sign…
cs.CV2025
CFSum: A Transformer-Based Multi-Modal Video Summarization Framework With Coarse-Fine Fusion
Yaowei Guo, Jiazheng Xing, Xiaojun Hou +5
Video summarization, by selecting the most informative and/or user-relevant parts of original videos to create concise summary videos, has high research value and consumer demand i…
cs.CV2024
Visual Object Tracking across Diverse Data Modalities: A Review
Mengmeng Wang, Teli Ma, Shuo Xin +5
Visual Object Tracking (VOT) is an attractive and significant research area in computer vision, which aims to recognize and track specific targets in video sequences where the targ…