R-C3D: Region Convolutional 3D Network for Temporal Activity Detection
arXiv:1703.07814
Abstract
We address the problem of activity detection in continuous, untrimmed video streams. This is a difficult task that requires extracting meaningful spatio-temporal features to capture activities, accurately localizing the start and end times of each activity. We introduce a new model, Region Convolutional 3D Network (R-C3D), which encodes the video streams using a three-dimensional fully convolutional network, then generates candidate temporal regions containing activities, and finally classifies selected regions into specific activities. Computation is saved due to the sharing of convolutional features between the proposal and the classification pipelines. The entire model is trained end-to-end with jointly optimized localization and classification losses. R-C3D is faster than existing methods (569 frames per second on a single Titan X Maxwell GPU) and achieves state-of-the-art results on THUMOS'14. We further demonstrate that our model is a general activity detection framework that does not rely on assumptions about particular dataset properties by evaluating our approach on ActivityNet and Charades. Our code is available at http://ai.bu.edu/r-c3d/.
ICCV 2017 Camera Ready Version
References in corpus (15)
- Very Deep Convolutional Networks for Large-Scale Image Recognition
- Two-Stream Convolutional Networks for Action Recognition in Videos
- Deep Residual Learning for Image Recognition
- R-FCN: Object Detection via Region-based Fully Convolutional Networks
- Rich feature hierarchies for accurate object detection and semantic segmentation
- Hollywood in Homes: Crowdsourcing Data Collection for Activity Understanding
- Temporal Action Localization in Untrimmed Videos via Multi-stage CNNs
- Learning Spatiotemporal Features with 3D Convolutional Networks
- Untrimmed Video Classification for Activity Detection: submission to ActivityNet Challenge
- Temporal Activity Detection in Untrimmed Videos with Recurrent Neural Networks
- Learning to track for spatio-temporal action localization
- CDC: Convolutional-De-Convolutional Networks for Precise Temporal Action Localization in Untrimmed Videos
- UntrimmedNets for Weakly Supervised Action Recognition and Detection
- Actionness Estimation Using Hybrid Fully Convolutional Networks
- Asynchronous Temporal Fields for Action Recognition
Cited by in corpus (28)
- BSN: Boundary Sensitive Network for Temporal Action Proposal Generation
- Weakly Supervised Action Localization by Sparse Temporal Pooling Network
- S3D: Single Shot multi-Span Detector via Fully 3D Convolutional Networks
- Rethinking the Faster R-CNN Architecture for Temporal Action Localization
- Multi-granularity Generator for Temporal Action Proposal
- Temporal Action Proposal Generation with Transformers
- CTAP: Complementary Temporal Action Proposal Generation
- Contextual Multi-Scale Region Convolutional 3D Network for Activity Detection
- LAP-Net: Adaptive Features Sampling via Learning Action Progression for Online Action Detection
- Fast Video Shot Transition Localization with Deep Structured Models
- Segregated Temporal Assembly Recurrent Networks for Weakly Supervised Multiple Action Detection
- Diagnosing Error in Temporal Action Detectors
- Decoupling Localization and Classification in Single Shot Temporal Action Detection
- Budget-Aware Activity Detection with A Recurrent Policy Network
- Multilevel Language and Vision Integration for Text-to-Clip Retrieval
- Action Search: Spotting Actions in Videos and Its Application to Temporal Action Localization
- Cascaded Pyramid Mining Network for Weakly Supervised Temporal Action Localization
- AutoLoc: Weakly-supervised Temporal Action Localization
- Online Detection of Action Start in Untrimmed, Streaming Videos
- A Comprehensive Study on Temporal Modeling for Online Action Detection
- OadTR: Online Action Detection with Transformers
- Follow the Attention: Combining Partial Pose and Object Motion for Fine-Grained Action Detection
- TAN: Temporal Aggregation Network for Dense Multi-label Action Recognition
- Temporal Action Detection by Joint Identification-Verification
- Attentive Sequence to Sequence Translation for Localizing Clips of Interest by Natural Language Descriptions
- Discovering Spatio-Temporal Action Tubes
- Differentiable Grammars for Videos
- Finding Action Tubes with a Sparse-to-Dense Framework