Neural Activation Constellations: Unsupervised Part Model Discovery with Convolutional Networks
arXiv:1504.08289
Abstract
Part models of object categories are essential for challenging recognition tasks, where differences in categories are subtle and only reflected in appearances of small parts of the object. We present an approach that is able to learn part models in a completely unsupervised manner, without part annotations and even without given bounding boxes during learning. The key idea is to find constellations of neural activation patterns computed using convolutional neural networks. In our experiments, we outperform existing approaches for fine-grained recognition on the CUB200-2011, NA birds, Oxford PETS, and Oxford Flowers dataset in case no part or bounding box annotations are available and achieve state-of-the-art performance for the Stanford Dog dataset. We also show the benefits of neural constellation models as a data augmentation technique for fine-tuning. Furthermore, our paper unites the areas of generic and fine-grained classification, since our approach is suitable for both scenarios. The source code of our method is available online at http://www.inf-cv.uni-jena.de/part_discovery
Published at IEEE International Conference on Computer Vision (ICCV) 2015
References in corpus (7)
- Very Deep Convolutional Networks for Large-Scale Image Recognition
- Going Deeper with Convolutions
- Return of the Devil in the Details: Delving Deep into Convolutional Nets
- Bird Species Categorization Using Pose Normalized Deep Convolutional Nets
- Attention for Fine-Grained Categorization
- Part Detector Discovery in Deep Convolutional Neural Networks
- Generalized Max Pooling
Cited by in corpus (44)
- Object-Part Attention Model for Fine-grained Image Classification
- Deep Image: Scaling up Image Recognition
- BoxCars: Improving Fine-Grained Recognition of Vehicles using 3-D Bounding Boxes in Traffic Surveillance
- The Devil is in the Tails: Fine-grained Classification in the Wild
- ImageNet pre-trained models with batch normalization
- Traffic Surveillance Camera Calibration by 3D Model Bounding Box Alignment for Accurate Vehicle Speed Measurement
- Mask-CNN: Localizing Parts and Selecting Descriptors for Fine-Grained Image Recognition
- Fast Fine-grained Image Classification via Weakly Supervised Discriminative Localization
- Bilinear CNNs for Fine-grained Visual Recognition
- Spatial Transformer Networks
- Fine-grained pose prediction, normalization, and recognition
- Unsupervised Semantic-based Aggregation of Deep Convolutional Features
- Unsupervised learning of object semantic parts from internal states of CNNs by population encoding
- Selective Convolutional Descriptor Aggregation for Fine-Grained Image Retrieval
- Interpreting CNN Knowledge via an Explanatory Graph
- Interpretable Convolutional Neural Networks
- The Unreasonable Effectiveness of Noisy Data for Fine-Grained Recognition
- Unsupervised Learning of Neural Networks to Explain Neural Networks
- Dynamic Computational Time for Visual Attention
- Interactively Transferring CNN Patterns for Part Localization
- Borrowing Treasures from the Wealthy: Deep Transfer Learning through Selective Joint Fine-tuning
- Hierarchical Bilinear Pooling for Fine-Grained Visual Recognition
- Visual Concepts and Compositional Voting
- What Catches the Eye? Visualizing and Understanding Deep Saliency Models
- Learning a Discriminative Filter Bank within a CNN for Fine-grained Recognition
- Examining CNN Representations with respect to Dataset Bias
- An Out-of-the-box Full-network Embedding for Convolutional Neural Networks
- Mining Object Parts from CNNs via Active Question-Answering
- Detecting Semantic Parts on Partially Occluded Objects
- Visual Concept Recognition and Localization via Iterative Introspection
- Building Graph Representations of Deep Vector Embeddings
- Learning from Web Data: the Benefit of Unsupervised Object Localization
- No Spare Parts: Sharing Part Detectors for Image Categorization
- Real Time Fine-Grained Categorization with Accuracy and Interpretability
- Mining Interpretable AOG Representations from Convolutional Networks via Active Question Answering
- Explanatory Graphs for CNNs
- Deep Collaborative Learning for Visual Recognition
- Compositional Model based Fisher Vector Coding for Image Classification
- Objects as context for detecting their semantic parts
- One-Shot Fine-Grained Instance Retrieval
- Cascade one-vs-rest detection network for fine-grained recognition without part annotations
- Deep Micro-Dictionary Learning and Coding Network
- Vision Recognition using Discriminant Sparse Optimization Learning
- Image Score: How to Select Useful Samples