8 papers · 1 filter
Continual Learning with Vision-Language Models via Semantic-Geometry Preservation
Chiyuan He, Zihuan Qiu, Fanman Meng +4
Continual learning of pretrained vision-language models (VLMs) is prone to catastrophic forgetting, yet current approaches adapt to new tasks without explicitly preserving the cros…
DesCLIP: Robust Continual Learning via General Attribute Descriptions for VLM-Based Visual Recognition
Chiyuan He, Zihuan Qiu, Fanman Meng +3
Continual learning of vision-language models (VLMs) focuses on leveraging cross-modal pretrained knowledge to incrementally adapt to expanding downstream tasks and datasets, while…
SAVA-X: Ego-to-Exo Imitation Error Detection via Scene-Adaptive View Alignment and Bidirectional Cross View Fusion
Xiang Li, Heqian Qiu, Lanxiao Wang +4
Error detection is crucial in industrial training, healthcare, and assembly quality control. Most existing work assumes a single-view setting and cannot handle the practical case w…
CMaP-SAM: Contraction Mapping Prior for SAM-driven Few-shot Segmentation
Shuai Chen, Fanman Meng, Liming Lei +5
Few-shot segmentation (FSS) aims to segment new classes using few annotated images. While recent FSS methods have shown considerable improvements by leveraging Segment Anything Mod…
No Re-Train, More Gain: Upgrading Backbones with Diffusion model for Pixel-Wise and Weakly-Supervised Few-Shot Segmentation
Shuai Chen, Fanman Meng, Chenhao Wu +5
Few-Shot Segmentation (FSS) aims to segment novel classes using only a few annotated images. Despite considerable progress under pixel-wise support annotation, current FSS methods…
ARIC: An Activity Recognition Dataset in Classroom Surveillance Images
Linfeng Xu, Fanman Meng, Qingbo Wu +16
The application of activity recognition in the ``AI + Education" field is gaining increasing attention. However, current work mainly focuses on the recognition of activities in man…