1 paper
Wenfeng Feng, Hongxiang Wang, Jianlong Wang +5
In this paper, we propose EDIT (Encoder-Decoder Image Transformer), a novel architecture designed to mitigate the attention sink phenomenon observed in Vision Transformer models. A…