Exploiting Linear Structure Within Convolutional Networks for Efficient Evaluation
arXiv:1404.0736
Abstract
We present techniques for speeding up the test-time evaluation of large convolutional networks, designed for object recognition tasks. These models deliver impressive accuracy but each image evaluation requires millions of floating point operations, making their deployment on smartphones and Internet-scale clusters problematic. The computation is dominated by the convolution operations in the lower layers of the model. We exploit the linear structure present within the convolutional filters to derive approximations that significantly reduce the required computation. Using large state-of-the-art models, we demonstrate we demonstrate speedups of convolutional layers on both CPU and GPU by a factor of 2x, while keeping the accuracy within 1% of the original model.
References in corpus (1)
Cited by in corpus (378)
- Knowledge Distillation: A Survey
- Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding
- Spatial Pyramid Pooling in Deep Convolutional Networks for Visual Recognition
- FitNets: Hints for Thin Deep Nets
- Convergence of Edge Computing and Deep Learning: A Comprehensive Survey
- AMC: AutoML for Model Compression and Acceleration on Mobile Devices
- Compressing Deep Convolutional Networks using Vector Quantization
- A Survey of Model Compression and Acceleration for Deep Neural Networks
- Learning both Weights and Connections for Efficient Neural Networks
- Tensorizing Neural Networks
- Compressing Neural Networks with the Hashing Trick
- Binary Neural Networks: A Survey
- FPGA-based Accelerators of Deep Learning Networks for Learning and Classification: A Review
- A Systematic DNN Weight Pruning Framework using Alternating Direction Method of Multipliers
- Learning Structured Sparsity in Deep Neural Networks
- Texture Synthesis Using Convolutional Neural Networks
- Aggregated Residual Transformations for Deep Neural Networks
- Convolutional neural networks with low-rank regularization
- Convolutional Neural Networks using Logarithmic Data Representation
- Channel Pruning for Accelerating Very Deep Neural Networks
- Like What You Like: Knowledge Distill via Neuron Selectivity Transfer
- Recent Advances in Convolutional Neural Networks
- Deep Roots: Improving CNN Efficiency with Hierarchical Filter Groups
- XNOR-Net: ImageNet Classification Using Binary Convolutional Neural Networks
- Learning Efficient Convolutional Networks through Network Slimming
- Pruning by Explaining: A Novel Criterion for Deep Neural Network Pruning
- Slalom: Fast, Verifiable and Private Execution of Neural Networks in Trusted Hardware
- A Comprehensive Survey on Model Quantization for Deep Neural Networks in Image Classification
- Flattened Convolutional Neural Networks for Feedforward Acceleration
- GhostNets on Heterogeneous Devices via Cheap Operations
- A Comprehensive guide to Bayesian Convolutional Neural Network with Variational Inference
- Discrimination-aware Channel Pruning for Deep Neural Networks
- Discrimination-aware Network Pruning for Deep Model Compression
- An Entropy-based Pruning Method for CNN Compression
- Image Super-Resolution Using Deep Convolutional Networks
- Dynamic Network Surgery for Efficient DNNs
- Exploring Sparsity in Recurrent Neural Networks
- Compression-aware Training of Deep Networks
- Faster CNNs with Direct Sparse Convolutions and Guided Pruning
- SVDNet for Pedestrian Retrieval
- PerforatedCNNs: Acceleration through Elimination of Redundant Convolutions
- Compression of Deep Convolutional Neural Networks for Fast and Low Power Mobile Applications
- GhostNet: More Features from Cheap Operations
- Light-Weight RefineNet for Real-Time Semantic Segmentation
- Sequence-Level Knowledge Distillation
- ThiNet: A Filter Level Pruning Method for Deep Neural Network Compression
- Ristretto: Hardware-Oriented Approximation of Convolutional Neural Networks
- Focus: Querying Large Video Datasets with Low Latency and Low Cost
- Block-Sparse Recurrent Neural Networks
- The Power of Sparsity in Convolutional Neural Networks
- ACNet: Strengthening the Kernel Skeletons for Powerful CNN via Asymmetric Convolution Blocks
- 3D RoI-aware U-Net for Accurate and Efficient Colorectal Tumor Segmentation
- Interleaved Group Convolutions for Deep Neural Networks
- Network Decoupling: From Regular to Depthwise Separable Convolutions
- A Low Effort Approach to Structured CNN Design Using PCA
- Rotated Binary Neural Network
- Deep Learning with Low Precision by Half-wave Gaussian Quantization
- And the Bit Goes Down: Revisiting the Quantization of Neural Networks
- NISP: Pruning Networks using Neuron Importance Score Propagation
- A Survey on Deep Neural Network Compression: Challenges, Overview, and Solutions
- Training Skinny Deep Neural Networks with Iterative Hard Thresholding Methods
- Compact recurrent neural networks for acoustic event detection on low-energy low-complexity platforms
- Bi-GCN: Binary Graph Convolutional Network
- Structured Probabilistic Pruning for Convolutional Neural Network Acceleration
- Lightweight Modules for Efficient Deep Learning based Image Restoration
- Automated Pruning for Deep Neural Network Compression
- Compacting Deep Neural Networks for Internet of Things: Methods and Applications
- Vision Transformer Pruning
- NeST: A Neural Network Synthesis Tool Based on a Grow-and-Prune Paradigm
- Low-complexity Approximate Convolutional Neural Networks
- An exploration of parameter redundancy in deep networks with circulant projections
- Drawing Early-Bird Tickets: Towards More Efficient Training of Deep Networks
- Model Rubik's Cube: Twisting Resolution, Depth and Width for TinyNets
- Efficient Processing of Deep Neural Networks: A Tutorial and Survey
- DeepIoT: Compressing Deep Neural Network Structures for Sensing Systems with a Compressor-Critic Framework
- From Hashing to CNNs: Training BinaryWeight Networks via Hashing
- Improving Efficiency in Convolutional Neural Network with Multilinear Filters
- Multilinear Compressive Learning
- More is Less: A More Complicated Network with Less Inference Complexity
- DCFNet: Deep Neural Network with Decomposed Convolutional Filters
- HAWQ: Hessian AWare Quantization of Neural Networks with Mixed-Precision
- Searching for Low-Bit Weights in Quantized Neural Networks
- Training Binary Neural Networks through Learning with Noisy Supervision
- DecomposeMe: Simplifying ConvNets for End-to-End Learning
- AutoPruner: An End-to-End Trainable Filter Pruning Method for Efficient Deep Model Inference
- TinyTL: Reduce Activations, Not Trainable Parameters for Efficient On-Device Learning
- Accelerating Neural ODEs Using Model Order Reduction
- Quantized Convolutional Neural Networks for Mobile Devices
- Towards Optimal Structured CNN Pruning via Generative Adversarial Learning
- Compressing Convolutional Neural Networks
- ChipNet: Budget-Aware Pruning with Heaviside Continuous Approximations
- FINN-R: An End-to-End Deep-Learning Framework for Fast Exploration of Quantized Neural Networks
- Accelerating Very Deep Convolutional Networks for Classification and Detection
- Global Second-order Pooling Convolutional Networks
- Exploiting Local Structures with the Kronecker Layer in Convolutional Networks
- Data-Driven Sparse Structure Selection for Deep Neural Networks
- Log-DenseNet: How to Sparsify a DenseNet
- Rethinking Weight Decay For Efficient Neural Network Pruning
- Convolutional Neural Networks at Constrained Time Cost
- Wide Compression: Tensor Ring Nets
- Learning to Prune Filters in Convolutional Neural Networks
- IGCV3: Interleaved Low-Rank Group Convolutions for Efficient Deep Neural Networks
- Model compression as constrained optimization, with application to neural nets. Part I: general framework
- Progressive DNN Compression: A Key to Achieve Ultra-High Weight Pruning and Quantization Rates using ADMM
- Communication-Efficient Edge AI: Algorithms and Systems
- Task dependent Deep LDA pruning of neural networks
- Computing Systems for Autonomous Driving: State-of-the-Art and Challenges
- Effectiveness of Distillation Attack and Countermeasure on Neural Network Watermarking
- Binary embeddings with structured hashed projections
- Provable Filter Pruning for Efficient Neural Networks
- Reliable Post hoc Explanations: Modeling Uncertainty in Explainability
- Learned Threshold Pruning
- Towards Effective Low-bitwidth Convolutional Neural Networks
- Model Slicing for Supporting Complex Analytics with Elastic Inference Cost and Resource Constraints
- A Programmable Approach to Neural Network Compression
- Lightweight Residual Densely Connected Convolutional Neural Network
- AutoQ: Automated Kernel-Wise Neural Network Quantization
- Resource-Efficient Neural Networks for Embedded Systems
- Rate Distortion For Model Compression: From Theory To Practice
- Joint Neural Architecture Search and Quantization
- Theoretical Properties for Neural Networks with Weight Matrices of Low Displacement Rank
- Parallel Separable 3D Convolution for Video and Volumetric Data Understanding
- Performance Guaranteed Network Acceleration via High-Order Residual Quantization
- Projection Convolutional Neural Networks for 1-bit CNNs via Discrete Back Propagation
- Fast ConvNets Using Group-wise Brain Damage
- Data-Independent Neural Pruning via Coresets
- Tensorial Neural Networks: Generalization of Neural Networks and Application to Model Compression
- FRILL: A Non-Semantic Speech Embedding for Mobile Devices
- Group Sparsity: The Hinge Between Filter Pruning and Decomposition for Network Compression
- Deep Fried Convnets
- Few Sample Knowledge Distillation for Efficient Network Compression
- Model Compression with Multi-Task Knowledge Distillation for Web-scale Question Answering System
- Knowledge Projection for Deep Neural Networks
- SiPPing Neural Networks: Sensitivity-informed Provable Pruning of Neural Networks
- Taxonomy and Evaluation of Structured Compression of Convolutional Neural Networks
- Grow and Prune Compact, Fast, and Accurate LSTMs
- Dynamic Zoom-in Network for Fast Object Detection in Large Images
- HALOC: Hardware-Aware Automatic Low-Rank Compression for Compact Neural Networks
- Dynamic Deep Neural Networks: Optimizing Accuracy-Efficiency Trade-offs by Selective Execution
- Exploiting Errors for Efficiency: A Survey from Circuits to Algorithms
- AdderNet: Do We Really Need Multiplications in Deep Learning?
- DeepObfuscation: Securing the Structure of Convolutional Neural Networks via Knowledge Distillation
- Constructing Deep Neural Networks by Bayesian Network Structure Learning
- Layer Pruning via Fusible Residual Convolutional Block for Deep Neural Networks
- Centripetal SGD for Pruning Very Deep Convolutional Networks with Complicated Structure
- Exploring the Design Space of Deep Convolutional Neural Networks at Large Scale
- Knowledge Squeezed Adversarial Network Compression
- Sparse Training via Boosting Pruning Plasticity with Neuroregeneration
- Shift-based Primitives for Efficient Convolutional Neural Networks
- Search for Better Students to Learn Distilled Knowledge
- Fine-Grained Neural Architecture Search
- On Periodic Functions as Regularizers for Quantization of Neural Networks
- Trained Rank Pruning for Efficient Deep Neural Networks
- OpenEI: An Open Framework for Edge Intelligence
- Pruning artificial neural networks: a way to find well-generalizing, high-entropy sharp minima
- BT-Nets: Simplifying Deep Neural Networks via Block Term Decomposition
- Towards Evolutional Compression
- Revisiting Dynamic Convolution via Matrix Decomposition
- RotDCF: Decomposition of Convolutional Filters for Rotation-Equivariant Deep Networks
- Toolflows for Mapping Convolutional Neural Networks on FPGAs: A Survey and Future Directions
- Evolution in Groups: A deeper look at synaptic cluster driven evolution of deep neural networks
- LCNN: Lookup-based Convolutional Neural Network
- All You Need is a Few Shifts: Designing Efficient Convolutional Neural Networks for Image Classification
- Equivalent and Approximate Transformations of Deep Neural Networks
- Understanding Generalization in Deep Learning via Tensor Methods
- Accelerating the Super-Resolution Convolutional Neural Network
- CGaP: Continuous Growth and Pruning for Efficient Deep Learning
- HRank: Filter Pruning using High-Rank Feature Map
- PAMS: Quantized Super-Resolution via Parameterized Max Scale
- Training Sparse Neural Networks
- Towards Compact ConvNets via Structure-Sparsity Regularized Filter Pruning
- ADMM-NN: An Algorithm-Hardware Co-Design Framework of DNNs Using Alternating Direction Method of Multipliers
- Learning Two Layer Rectified Neural Networks in Polynomial Time
- ModelHub: Towards Unified Data and Lifecycle Management for Deep Learning
- A Lite Distributed Semantic Communication System for Internet of Things
- Coordinating Filters for Faster Deep Neural Networks
- Compression based bound for non-compressed network: unified generalization error analysis of large compressible deep neural network
- ApproxNet: Content and Contention-Aware Video Analytics System for Embedded Clients
- XSepConv: Extremely Separated Convolution
- GASL: Guided Attention for Sparsity Learning in Deep Neural Networks
- DeepFont: Identify Your Font from An Image
- Accelerating Deep Unsupervised Domain Adaptation with Transfer Channel Pruning
- Depthwise Multiception Convolution for Reducing Network Parameters without Sacrificing Accuracy
- Efficient Inference of CNNs via Channel Pruning
- Inference, Learning and Attention Mechanisms that Exploit and Preserve Sparsity in Convolutional Networks
- Channel-wise Hessian Aware trace-Weighted Quantization of Neural Networks
- Real-time convolutional networks for sonar image classification in low-power embedded systems
- Effective Training of Convolutional Neural Networks with Low-bitwidth Weights and Activations
- Fully-adaptive Feature Sharing in Multi-Task Networks with Applications in Person Attribute Classification
- Implicit Regularization of Stochastic Gradient Descent in Natural Language Processing: Observations and Implications
- SmartExchange: Trading Higher-cost Memory Storage/Access for Lower-cost Computation
- SpecNet: Spectral Domain Convolutional Neural Network
- PENNI: Pruned Kernel Sharing for Efficient CNN Inference
- Faster Neural Network Training with Approximate Tensor Operations
- Structured Convolutions for Efficient Neural Network Design
- Dynamic Capacity Networks
- Learning Versatile Convolution Filters for Efficient Visual Recognition
- A practical convolutional neural network as loop filter for intra frame
- Toward Compact Deep Neural Networks via Energy-Aware Pruning
- Depth-wise Decomposition for Accelerating Separable Convolutions in Efficient Convolutional Neural Networks
- Iterative Low-Rank Approximation for CNN Compression
- Structured Pruning for Efficient ConvNets via Incremental Regularization
- To Compress, or Not to Compress: Characterizing Deep Learning Model Compression for Embedded Inference
- Collaborative Distillation for Ultra-Resolution Universal Style Transfer
- Multiscale Hierarchical Convolutional Networks
- Pruning Deep Neural Networks using Partial Least Squares
- Deep Learning Towards Mobile Applications
- Learning Filter Basis for Convolutional Neural Network Compression
- Learning Strict Identity Mappings in Deep Residual Networks
- Partition Pruning: Parallelization-Aware Pruning for Deep Neural Networks
- Sparsifying Neural Network Connections for Face Recognition
- Robustness via Deep Low-Rank Representations
- Model Compression with Two-stage Multi-teacher Knowledge Distillation for Web Question Answering System
- Learning Student Networks via Feature Embedding
- Data-Free Learning of Student Networks
- Weight Pruning via Adaptive Sparsity Loss
- Shapley Value as Principled Metric for Structured Network Pruning
- Learning Low-rank Deep Neural Networks via Singular Vector Orthogonality Regularization and Singular Value Sparsification
- CNN Acceleration by Low-rank Approximation with Quantized Factors
- DEEPEYE: A Compact and Accurate Video Comprehension at Terminal Devices Compressed with Quantization and Tensorization
- Data-Dependent Coresets for Compressing Neural Networks with Applications to Generalization Bounds
- Deep learning in bioinformatics: introduction, application, and perspective in big data era
- Computational optimization of convolutional neural networks using separated filters architecture
- Ensemble-Compression: A New Method for Parallel Training of Deep Neural Networks
- Exploiting Channel Similarity for Accelerating Deep Convolutional Neural Networks
- Dependency Aware Filter Pruning
- Spectral Pruning: Compressing Deep Neural Networks via Spectral Analysis and its Generalization Error
- Compressed Learning of Deep Neural Networks for OpenCL-Capable Embedded Systems
- Data Efficient Stagewise Knowledge Distillation
- BitNet: Bit-Regularized Deep Neural Networks
- A flexible, extensible software framework for model compression based on the LC algorithm
- Curb Your Carbon Emissions: Benchmarking Carbon Emissions in Machine Translation
- Symmetric block-low-rank layers for fully reversible multilevel neural networks
- DeepWear: Adaptive Local Offloading for On-Wearable Deep Learning
- Adaptive Memory Networks
- Manipulating Identical Filter Redundancy for Efficient Pruning on Deep and Complicated CNN
- Distilling portable Generative Adversarial Networks for Image Translation
- DeepLight: Deep Lightweight Feature Interactions for Accelerating CTR Predictions in Ad Serving
- Neural Pruning via Growing Regularization
- How Not to Give a FLOP: Combining Regularization and Pruning for Efficient Inference
- VACL: Variance-Aware Cross-Layer Regularization for Pruning Deep Residual Networks
- Scaling Up Exact Neural Network Compression by ReLU Stability
- Network Pruning using Adaptive Exemplar Filters
- DelugeNets: Deep Networks with Efficient and Flexible Cross-layer Information Inflows
- Dynamic Neural Network Channel Execution for Efficient Training
- Connectivity Matters: Neural Network Pruning Through the Lens of Effective Sparsity
- Compressing Neural Networks: Towards Determining the Optimal Layer-wise Decomposition
- Accelerate CNN via Recursive Bayesian Pruning
- Dynamic Group Convolution for Accelerating Convolutional Neural Networks
- A Survey of Mobile Computing for the Visually Impaired
- REPrune: Filter Pruning via Representative Election
- Data-Independent Structured Pruning of Neural Networks via Coresets
- Fully Learnable Group Convolution for Acceleration of Deep Neural Networks
- No Multiplication? No Floating Point? No Problem! Training Networks for Efficient Inference
- Compression of Fully-Connected Layer in Neural Network by Kronecker Product
- Automatic Rank Selection for High-Speed Convolutional Neural Network
- GroupReduce: Block-Wise Low-Rank Approximation for Neural Language Model Shrinking
- Detecting Dead Weights and Units in Neural Networks
- WSNet: Compact and Efficient Networks Through Weight Sampling
- Pruning Convolutional Neural Networks for Image Instance Retrieval
- Multi-modal Experts Network for Autonomous Driving
- Merging and Evolution: Improving Convolutional Neural Networks for Mobile Applications
- Network Automatic Pruning: Start NAP and Take a Nap
- Training convolutional neural networks with cheap convolutions and online distillation
- Efficient Computation Reduction in Bayesian Neural Networks Through Feature Decomposition and Memorization
- Adaptive Low-Rank Factorization to regularize shallow and deep neural networks
- Activation Density driven Energy-Efficient Pruning in Training
- Correlation Congruence for Knowledge Distillation
- EasyConvPooling: Random Pooling with Easy Convolution for Accelerating Training and Testing
- Optimal Quantization for Batch Normalization in Neural Network Deployments and Beyond
- 3D Dense Separated Convolution Module for Volumetric Image Analysis
- A First Look at Deep Learning Apps on Smartphones
- Principal Component Networks: Parameter Reduction Early in Training
- Compression of Deep Neural Networks on the Fly
- Tangent Space Separability in Feedforward Neural Networks
- Joint Architecture and Knowledge Distillation in CNN for Chinese Text Recognition
- Impostor Networks for Fast Fine-Grained Recognition
- CP-decomposition with Tensor Power Method for Convolutional Neural Networks Compression
- ThumbNet: One Thumbnail Image Contains All You Need for Recognition
- RecNets: Channel-wise Recurrent Convolutional Neural Networks
- Scalable Neural Network Compression and Pruning Using Hard Clustering and L1 Regularization
- Fast Training of Convolutional Neural Networks via Kernel Rescaling
- GDRQ: Group-based Distribution Reshaping for Quantization
- The Disruptions of 5G on Data-driven Technologies and Applications
- Deep Neural Network Approximation using Tensor Sketching
- Spirit Distillation: Precise Real-time Semantic Segmentation of Road Scenes with Insufficient Data
- Neural Machine Translation: A Review and Survey
- Deeplite Neutrino: An End-to-End Framework for Constrained Deep Learning Model Optimization
- UCP: Uniform Channel Pruning for Deep Convolutional Neural Networks Compression and Acceleration
- Channel Pruning via Optimal Thresholding
- BasisConv: A method for compressed representation and learning in CNNs
- Balanced Quantization: An Effective and Efficient Approach to Quantized Neural Networks
- Universal Adder Neural Networks
- Recent Advances in Convolutional Neural Network Acceleration
- A Unified Approximation Framework for Compressing and Accelerating Deep Neural Networks
- DECORE: Deep Compression with Reinforcement Learning
- Diagonalwise Refactorization: An Efficient Training Method for Depthwise Convolutions
- Exploring Weight Symmetry in Deep Neural Networks
- MUSCO: Multi-Stage Compression of neural networks
- Reaching Data Confidentiality and Model Accountability on the CalTrain
- Deep Learning Acceleration Techniques for Real Time Mobile Vision Applications
- Rapid Elastic Architecture Search under Specialized Classes and Resource Constraints
- Improving Network Slimming with Nonconvex Regularization
- Rethinking the Value of Transformer Components
- Domain Adaptation Regularization for Spectral Pruning
- Accelerating Training using Tensor Decomposition
- Class-dependent Compression of Deep Neural Networks
- Full-Stack Filters to Build Minimum Viable CNNs
- Learning Instance-wise Sparsity for Accelerating Deep Models
- Efficient and Robust Machine Learning for Real-World Systems
- Neural Rejuvenation: Improving Deep Network Training by Enhancing Computational Resource Utilization
- Composite Binary Decomposition Networks
- Scaling Up Deep Neural Network Optimization for Edge Inference
- Robust Student Network Learning
- Faster Convergence & Generalization in DNNs
- Compact Deep Neural Networks for Computationally Efficient Gesture Classification From Electromyography Signals
- Localized Compression: Applying Convolutional Neural Networks to Compressed Images
- Building Fast and Compact Convolutional Neural Networks for Offline Handwritten Chinese Character Recognition
- Information-Theoretic Understanding of Population Risk Improvement with Model Compression
- Towards thinner convolutional neural networks through Gradually Global Pruning
- Reducing the Model Order of Deep Neural Networks Using Information Theory
- Filter sharing: Efficient learning of parameters for volumetric convolutions
- Joint Matrix Decomposition for Deep Convolutional Neural Networks Compression
- Cascaded Coarse-to-Fine Deep Kernel Networks for Efficient Satellite Image Change Detection
- Radius Adaptive Convolutional Neural Network
- 4-Connected Shift Residual Networks
- Deep Learning Approximation: Zero-Shot Neural Network Speedup
- Expressive power of outer product manifolds on feed-forward neural networks
- Compressing Deep Convolutional Neural Networks by Stacking Low-dimensional Binary Convolution Filters
- RGP: Neural Network Pruning through Its Regular Graph Structure
- MICIK: MIning Cross-Layer Inherent Similarity Knowledge for Deep Model Compression
- An Overview of Datatype Quantization Techniques for Convolutional Neural Networks
- MBS: Macroblock Scaling for CNN Model Reduction
- Efficient Fusion of Sparse and Complementary Convolutions
- Layer Reduction: Accelerating Conformer-Based Self-Supervised Model via Layer Consistency
- Virtual Experience to Real World Application: Sidewalk Obstacle Avoidance Using Reinforcement Learning for Visually Impaired
- Compression-aware Continual Learning using Singular Value Decomposition
- Penetrating the Fog: the Path to Efficient CNN Models
- Reliable Identification of Redundant Kernels for Convolutional Neural Network Compression
- ViP: Virtual Pooling for Accelerating CNN-based Image Classification and Object Detection
- Regularized L21-Based Semi-NonNegative Matrix Factorization
- Justlookup: One Millisecond Deep Feature Extraction for Point Clouds By Lookup Tables
- Tensor Methods for Generating Compact Uncertainty Quantification and Deep Learning Models
- Knowledge Distillation By Sparse Representation Matching
- MiSC: Mixed Strategies Crowdsourcing
- Progressive Compressed Records: Taking a Byte out of Deep Learning Data
- New Results on CGR/CUR Approximation of a Matrix
- Deep Model Compression Via Two-Stage Deep Reinforcement Learning
- Parallel Blockwise Knowledge Distillation for Deep Neural Network Compression
- An Acceleration Method Based on Deep Learning and Multilinear Feature Space
- Alternate Model Growth and Pruning for Efficient Training of Recommendation Systems
- LEAN: graph-based pruning for convolutional neural networks by extracting longest chains
- Towards Mixed-Precision Quantization of Neural Networks via Constrained Optimization
- NodeDrop: A Condition for Reducing Network Size without Effect on Output
- ADA-Tucker: Compressing Deep Neural Networks via Adaptive Dimension Adjustment Tucker Decomposition
- Neural network compression via learnable wavelet transforms
- A One-step Pruning-recovery Framework for Acceleration of Convolutional Neural Networks
- OICSR: Out-In-Channel Sparsity Regularization for Compact Deep Neural Networks
- Architecture Aware Latency Constrained Sparse Neural Networks
- Deeply Shared Filter Bases for Parameter-Efficient Convolutional Neural Networks
- Identifying and Exploiting Structures for Reliable Deep Learning
- Dep-: Improving -based Network Sparsification via Dependency Modeling
- Block-term Tensor Neural Networks
- Multi-objective Evolutionary Approach for Efficient Kernel Size and Shape for CNN
- Cogradient Descent for Dependable Learning
- Scalable Compression of Deep Neural Networks
- Multilinear Map Layer: Prediction Regularization by Structural Constraint
- Quantized Neural Networks via {-1, +1} Encoding Decomposition and Acceleration
- Be Your Own Best Competitor! Multi-Branched Adversarial Knowledge Transfer
- Adaptive Low-Rank Regularization with Damping Sequences to Restrict Lazy Weights in Deep Networks
- A Highly Effective Low-Rank Compression of Deep Neural Networks with Modified Beam-Search and Modified Stable Rank
- Sparsity-Control Ternary Weight Networks
- A Survey on Green Deep Learning
- A Note on Latency Variability of Deep Neural Networks for Mobile Inference
- HOTCAKE: Higher Order Tucker Articulated Kernels for Deeper CNN Compression
- Recurrent Residual Module for Fast Inference in Videos
- Magnitude and Uncertainty Pruning Criterion for Neural Networks
- clcNet: Improving the Efficiency of Convolutional Neural Network using Channel Local Convolutions