4 papers · 1 filter
Exploring the Temporal Consistency for Point-Level Weakly-Supervised Temporal Action Localization
Yunchuan Ma, Laiyun Qing, Guorong Li +3
Point-supervised Temporal Action Localization (PTAL) adopts a lightly frame-annotated paradigm (\textit{i.e.}, labeling only a single frame per action instance) to train a model to…
Boosting Point-supervised Temporal Action Localization via Text Refinement and Alignment
Yunchuan Ma, Laiyun Qing, Guorong Li +3
Recently, point-supervised temporal action localization has gained significant attention for its effective balance between labeling costs and localization accuracy. However, curren…
RETTA: Retrieval-Enhanced Test-Time Adaptation for Zero-Shot Video Captioning
Yunchuan Ma, Laiyun Qing, Guorong Li +4
Despite the significant progress of fully-supervised video captioning, zero-shot methods remain much less explored. In this paper, we propose a novel zero-shot video captioning fra…
SOVC: Subject-Oriented Video Captioning
Chang Teng, Yunchuan Ma, Guorong Li +3
Describing video content according to users' needs is a long-held goal. Although existing video captioning methods have made significant progress, the generated captions may not fo…