Stein Variational Gradient Descent as Gradient Flow
arXiv:1704.07520
Abstract
Stein variational gradient descent (SVGD) is a deterministic sampling algorithm that iteratively transports a set of particles to approximate given distributions, based on an efficient gradient-based update that guarantees to optimally decrease the KL divergence within a function space. This paper develops the first theoretical analysis on SVGD, discussing its weak convergence properties and showing that its asymptotic behavior is captured by a gradient flow of the KL divergence functional under a new metric structure induced by Stein operator. We also provide a number of results on Stein operator and Stein's identity using the notion of weak derivative, including a new proof of the distinguishability of Stein discrepancy under weak conditions.
Cited by in corpus (58)
- Bayesian Deep Convolutional Encoder-Decoder Networks for Surrogate Modeling and Uncertainty Quantification
- Quantifying model form uncertainty in Reynolds-averaged turbulence models with Bayesian deep neural networks
- Interacting particle solutions of Fokker-Planck equations through gradient-log-density estimation
- Maximum Mean Discrepancy Gradient Flow
- Stein Variational Gradient Descent With Matrix-Valued Kernels
- A Stein variational Newton method
- On the geometry of Stein variational gradient descent
- A stochastic version of Stein Variational Gradient Descent for efficient sampling
- An introduction to variational inference in Geophysical inverse problems
- A Non-Asymptotic Analysis for Stein Variational Gradient Descent
- Sampling as optimization in the space of measures: The Langevin dynamics as a composite optimization problem
- Stein Variational Gradient Descent Without Gradient
- Stochastic Gradient MCMC with Repulsive Forces
- Accelerating Langevin Sampling with Birth-death
- Stein variational gradient descent with local approximations
- Particle-based Energetic Variational Inference
- Repulsive Deep Ensembles are Bayesian
- Greedy inference with structure-exploiting lazy maps
- Particle Optimization in Stochastic Gradient MCMC
- Stochastic Stein Discrepancies
- Information Newton's flow: second-order optimization method in probability space
- Scaling limit of the Stein variational gradient descent: the mean field regime
- Wasserstein variational gradient descent: From semi-discrete optimal transport to ensemble variational inference
- Straight-Through Estimator as Projected Wasserstein Gradient Flow
- Stein Variational Online Changepoint Detection with Applications to Hawkes Processes and Neural Networks
- Parameter Estimation for the McKean-Vlasov Stochastic Differential Equation
- On Stein Variational Neural Network Ensembles
- Stein Self-Repulsive Dynamics: Benefits From Past Samples
- Kernel Stein Generative Modeling
- Applying SVGD to Bayesian Neural Networks for Cyclical Time-Series Prediction and Inference
- New particle representations for ergodic McKean-Vlasov SDEs
- Deep Generative Learning via Variational Gradient Flow
- Sinkhorn Barycenter via Functional Gradient Descent
- KALE Flow: A Relaxed KL Gradient Flow for Probabilities with Disjoint Support
- Stein Variational Inference for Discrete Distributions
- Stein Variational Gaussian Processes
- Refining Deep Generative Models via Discriminator Gradient Flow
- The Wasserstein Proximal Gradient Algorithm
- Variational Transport: A Convergent Particle-BasedAlgorithm for Distributional Optimization
- Loss function based second-order Jensen inequality and its application to particle variational inference
- Sampling with Mirrored Stein Operators
- Generative Learning With Euler Particle Transport
- Understanding MCMC Dynamics as Flows on the Wasserstein Space
- The equivalence between Stein variational gradient descent and black-box variational inference
- Stein variational reduced basis Bayesian inversion
- Bayesian posterior approximation via greedy particle optimization
- Hessian transport gradient flows
- Scalable Approximate Inference and Some Applications
- Doubly Robust Stein-Kernelized Monte Carlo Estimator: Simultaneous Bias-Variance Reduction and Supercanonical Convergence
- Stabilizing Training of Generative Adversarial Nets via Langevin Stein Variational Gradient Descent
- A Variational View on Bootstrap Ensembles as Bayesian Inference
- Accelerated Information Gradient flow
- Neural Variational Gradient Descent
- Contributions to Large Scale Bayesian Inference and Adversarial Machine Learning
- Generative Particle Variational Inference via Estimation of Functional Gradients
- Relative Entropy Gradient Sampler for Unnormalized Distributions
- Multilevel Stein variational gradient descent with applications to Bayesian inverse problems
- A Wasserstein Minimum Velocity Approach to Learning Unnormalized Models