1 paper
Hongwei Fang, Jiahang Cai, Xun Wang +1
Vision Transformers (ViTs) have recently achieved state-of-the-art performance in 2D human pose estimation due to their strong global modeling capability. However, existing ViT-bas…