1 citations · 3 across the 3 of their papers we have counts for
3 papers
HQ-VAE: Hierarchical Discrete Representation Learning with Variational Bayes
Yuhta Takida, Yukara Ikemiya, Takashi Shibuya +8
Vector quantization (VQ) is a technique to deterministically learn features with discrete codebook representations. It is commonly performed with a variational autoencoding model,…
On the Language Encoder of Contrastive Cross-modal Models
Mengjie Zhao, Junya Ono, Zhi Zhong +7
Contrastive cross-modal models such as CLIP and CLAP aid various vision-language (VL) and audio-language (AL) tasks. However, there has been limited investigation of and improvemen…
VRDMG: Vocal Restoration via Diffusion Posterior Sampling with Multiple Guidance
Carlos Hernandez-Olivan, Koichi Saito, Naoki Murata +4
Restoring degraded music signals is essential to enhance audio quality for downstream music manipulation. Recent diffusion-based music restoration methods have demonstrated impress…