1 paper · 1 filter
Vahid Jebraeeli, Hamid Krim, Derya Cansever
Vision Transformer (ViT) based autoencoders often underutilize the global Class token and employ static attention mechanisms, limiting both generative control and optimization effi…