Convolutional Two-Stream Network Fusion for Video Action Recognition
arXiv:1604.06573
Abstract
Recent applications of Convolutional Neural Networks (ConvNets) for human action recognition in videos have proposed different solutions for incorporating the appearance and motion information. We study a number of ways of fusing ConvNet towers both spatially and temporally in order to best take advantage of this spatio-temporal information. We make the following findings: (i) that rather than fusing at the softmax layer, a spatial and temporal network can be fused at a convolution layer without loss of performance, but with a substantial saving in parameters; (ii) that it is better to fuse such networks spatially at the last convolutional layer than earlier, and that additionally fusing at the class prediction layer can boost accuracy; finally (iii) that pooling of abstract convolutional features over spatiotemporal neighbourhoods further boosts performance. Based on these studies we propose a new ConvNet architecture for spatiotemporal fusion of video snippets, and evaluate its performance on standard benchmarks where this architecture achieves state-of-the-art results.
in Proc. CVPR 2016
References in corpus (5)
- Very Deep Convolutional Networks for Large-Scale Image Recognition
- Two-Stream Convolutional Networks for Action Recognition in Videos
- Return of the Devil in the Details: Delving Deep into Convolutional Nets
- Towards Good Practices for Very Deep Two-Stream ConvNets
- Bag of Visual Words and Fusion Methods for Action Recognition: Comprehensive Study and Good Practice
Cited by in corpus (145)
- Deep Audio-Visual Speech Recognition
- Learning Spatio-Temporal Representation with Pseudo-3D Residual Networks
- A Closer Look at Spatiotemporal Convolutions for Action Recognition
- Attentional Pooling for Action Recognition
- Temporal 3D ConvNets: New Architecture and Transfer Learning for Video Classification
- Multi-style Generative Network for Real-time Transfer
- What Do We Understand About Convolutional Networks?
- BSN: Boundary Sensitive Network for Temporal Action Proposal Generation
- Memory-augmented Dense Predictive Coding for Video Representation Learning
- End-to-End Multi-Channel Speech Separation
- Learning Spatio-Temporal Features with 3D Residual Networks for Action Recognition
- Regularizing Deep Neural Networks by Noise: Its Interpretation and Optimization
- Temporal Convolution Based Action Proposal: Submission to ActivityNet 2017
- CDC: Convolutional-De-Convolutional Networks for Precise Temporal Action Localization in Untrimmed Videos
- Weakly Supervised Action Localization by Sparse Temporal Pooling Network
- Learning Spatio-Temporal Features with Two-Stream Deep 3D CNNs for Lipreading
- Appearance-and-Relation Networks for Video Classification
- S3D: Single Shot multi-Span Detector via Fully 3D Convolutional Networks
- Skeleton-based Action Recognition of People Handling Objects
- TS-LSTM and Temporal-Inception: Exploiting Spatiotemporal Dynamics for Activity Recognition
- Multi-Modality Fusion based on Consensus-Voting and 3D Convolution for Isolated Gesture Recognition
- Adversarial Attacks for Optical Flow-Based Action Recognition Classifiers
- Efficient Two-Stream Motion and Appearance 3D CNNs for Video Classification
- UntrimmedNets for Weakly Supervised Action Recognition and Detection
- Correlation Net: Spatiotemporal multimodal deep learning for action recognition
- OREBA: A Dataset for Objectively Recognizing Eating Behaviour and Associated Intake
- Multi-scale 3D Convolution Network for Video Based Person Re-Identification
- Multi Modal Convolutional Neural Networks for Brain Tumor Segmentation
- Temporal Pyramid Network for Action Recognition
- TAM: Temporal Adaptive Module for Video Recognition
- Exploiting the ConvLSTM: Human Action Recognition using Raw Depth Video-Based Recurrent Neural Networks
- Deep Stereo Matching with Explicit Cost Aggregation Sub-Architecture
- Lattice Long Short-Term Memory for Human Action Recognition
- Attention Clusters: Purely Attention Based Local Feature Integration for Video Classification
- A Multi-Stream Convolutional Neural Network Framework for Group Activity Recognition
- Parallel Separable 3D Convolution for Video and Volumetric Data Understanding
- Learning Discriminative Motion Features Through Detection
- First-Person Hand Action Benchmark with RGB-D Videos and 3D Hand Pose Annotations
- Video Representation Learning Using Discriminative Pooling
- Generalized Rank Pooling for Activity Recognition
- PredNet and Predictive Coding: A Critical Review
- Deep Projective 3D Semantic Segmentation
- Attention-based Temporal Weighted Convolutional Neural Network for Action Recognition
- Deep Keyframe Detection in Human Action Videos
- Memory Warps for Learning Long-Term Online Video Representations
- Let's Dance: Learning From Online Dance Videos
- End-to-end Video-level Representation Learning for Action Recognition
- Video-based Person Re-identification with Accumulative Motion Context
- Deep Action- and Context-Aware Sequence Learning for Activity Recognition and Anticipation
- Learning to Anonymize Faces for Privacy Preserving Action Detection
- Multi-Fiber Networks for Video Recognition
- Deep Temporal Linear Encoding Networks
- Deep Heterogeneous Feature Fusion for Template-Based Face Recognition
- LAP-Net: Adaptive Features Sampling via Learning Action Progression for Online Action Detection
- Hierarchical Contrastive Motion Learning for Video Action Recognition
- Attend and Interact: Higher-Order Object Interactions for Video Understanding
- Predicting Gaze in Egocentric Video by Learning Task-dependent Attention Transition
- Differential Angular Imaging for Material Recognition
- Im2Flow: Motion Hallucination from Static Images for Action Recognition
- Collaborative Distillation in the Parameter and Spectrum Domains for Video Action Recognition
- Vision-based Detection of Acoustic Timed Events: a Case Study on Clarinet Note Onsets
- ActionFlowNet: Learning Motion Representation for Action Recognition
- AMTnet: Action-Micro-Tube Regression by End-to-end Trainable Deep Architecture
- Two-stream Flow-guided Convolutional Attention Networks for Action Recognition
- Discriminative convolutional Fisher vector network for action recognition
- Deep Quantization: Encoding Convolutional Activations with Deep Generative Model
- Learning to score the figure skating sports videos
- Fully-Coupled Two-Stream Spatiotemporal Networks for Extremely Low Resolution Action Recognition
- Learning Human Pose Models from Synthesized Data for Robust RGB-D Action Recognition
- Social Scene Understanding: End-to-End Multi-Person Action Localization and Collective Activity Recognition
- Two-stream Collaborative Learning with Spatial-Temporal Attention for Video Classification
- Sympathy for the Details: Dense Trajectories and Hybrid Classification Architectures for Action Recognition
- ReHAR: Robust and Efficient Human Activity Recognition
- PM-GANs: Discriminative Representation Learning for Action Recognition Using Partial-modalities
- Multi-Level Recurrent Residual Networks for Action Recognition
- Eigen Evolution Pooling for Human Action Recognition
- Object Discovery in Videos as Foreground Motion Clustering
- Modeling Multimodal Clues in a Hybrid Deep Learning Framework for Video Classification
- Temporal Human Action Segmentation via Dynamic Clustering
- MotionSqueeze: Neural Motion Feature Learning for Video Understanding
- Pillar Networks++: Distributed non-parametric deep and wide networks
- RGB-D Based Action Recognition with Light-weight 3D Convolutional Networks
- NeXtVLAD: An Efficient Neural Network to Aggregate Frame-level Features for Large-scale Video Classification
- Convolutional Relational Machine for Group Activity Recognition
- Learning long-term dependencies for action recognition with a biologically-inspired deep network
- Fusing Motion Patterns and Key Visual Information for Semantic Event Recognition in Basketball Videos
- Action Recognition with Coarse-to-Fine Deep Feature Integration and Asynchronous Fusion
- Low-Fidelity End-to-End Video Encoder Pre-training for Temporal Action Localization
- Trespassing the Boundaries: Labeling Temporal Bounds for Object Interactions in Egocentric Video
- ActionVLAD: Learning spatio-temporal aggregation for action classification
- Generalized Zero-Shot Learning for Action Recognition with Web-Scale Video Data
- Residual Frames with Efficient Pseudo-3D CNN for Human Action Recognition
- Audio-Visual Speech Enhancement Using Multimodal Deep Convolutional Neural Networks
- Three-Stream Convolutional Networks for Video-based Person Re-Identification
- Action Sets: Weakly Supervised Action Segmentation without Ordering Constraints
- Action Tubelet Detector for Spatio-Temporal Action Localization
- Towards an Unequivocal Representation of Actions
- Motion Feature Network: Fixed Motion Filter for Action Recognition
- LIGAR: Lightweight General-purpose Action Recognition
- Discriminatively Learned Hierarchical Rank Pooling Networks
- Learning Spatiotemporal Features for Infrared Action Recognition with 3D Convolutional Neural Networks
- Learning Spatio-Temporal Representation with Local and Global Diffusion
- Temporal Hockey Action Recognition via Pose and Optical Flows
- Spatial-Temporal Multi-Cue Network for Continuous Sign Language Recognition
- MOD: A Deep Mixture Model with Online Knowledge Distillation for Large Scale Video Temporal Concept Localization
- Multi-Modal Active Learning for Automatic Liver Fibrosis Diagnosis based on Ultrasound Shear Wave Elastography
- Skeleton-based Hand-Gesture Recognition with Lightweight Graph Convolutional Networks
- Video Question Generation via Cross-Modal Self-Attention Networks Learning
- Inter-BMV: Interpolation with Block Motion Vectors for Fast Semantic Segmentation on Video
- Deep Unsupervised Multi-View Detection of Video Game Stream Highlights
- Modality Distillation with Multiple Stream Networks for Action Recognition
- Real-time Online Action Detection Forests using Spatio-temporal Contexts
- Action Recognition with Spatio-Temporal Visual Attention on Skeleton Image Sequences
- Ordered Pooling of Optical Flow Sequences for Action Recognition
- Semi-Coupled Two-Stream Fusion ConvNets for Action Recognition at Extremely Low Resolutions
- Action Representation Using Classifier Decision Boundaries
- A Comprehensive Study on Temporal Modeling for Online Action Detection
- Spatio-Temporal Interaction Graph Parsing Networks for Human-Object Interaction Recognition
- Dense Multimodal Fusion for Hierarchically Joint Representation
- Semantic Adversarial Network with Multi-scale Pyramid Attention for Video Classification
- Follow the Attention: Combining Partial Pose and Object Motion for Fine-Grained Action Detection
- Deep-Temporal LSTM for Daily Living Action Recognition
- Chained Multi-stream Networks Exploiting Pose, Motion, and Appearance for Action Classification and Detection
- Writing in The Air: Unconstrained Text Recognition from Finger Movement Using Spatio-Temporal Convolution
- Unsupervised Human Action Detection by Action Matching
- Joint Max Margin and Semantic Features for Continuous Event Detection in Complex Scenes
- Improving Classification by Improving Labelling: Introducing Probabilistic Multi-Label Object Interaction Recognition
- Temporal-Spatial Mapping for Action Recognition
- Online Detection of Action Start in Untrimmed, Streaming Videos
- T-RECS: Training for Rate-Invariant Embeddings by Controlling Speed for Action Recognition
- Few-Shot Adaptation for Multimedia Semantic Indexing
- A Genetic Feature Selection Based Two-stream Neural Network for Anger Veracity Recognition
- cvpaper.challenge in 2016: Futuristic Computer Vision through 1,600 Papers Survey
- Real-time Action Recognition with Dissimilarity-based Training of Specialized Module Networks
- Learning Conditional Random Fields with Augmented Observations for Partially Observed Action Recognition
- Adaptive Noise Injection: A Structure-Expanding Regularization for RNN
- Attention Filtering for Multi-person Spatiotemporal Action Detection on Deep Two-Stream CNN Architectures
- Perceptron Synthesis Network: Rethinking the Action Scale Variances in Videos
- Channel-Temporal Attention for First-Person Video Domain Adaptation
- SlowFast Rolling-Unrolling LSTMs for Action Anticipation in Egocentric Videos
- Making a Case for Learning Motion Representations with Phase
- Face-Focused Cross-Stream Network for Deception Detection in Videos
- TAN: Temporal Aggregation Network for Dense Multi-label Action Recognition
- Sequence Summarization Using Order-constrained Kernelized Feature Subspaces
- Large-Scale Mapping of Human Activity using Geo-Tagged Videos