1 paper
Kohei Yamamoto, Kosuke Okusa
Transformer-based audio self-supervised learning (SSL) models commonly use spectrograms, vision-style Transformers, and masked modeling objectives. However, convolutional patchific…