1 paper
Jiafu Wu, Jian Li, Jiangning Zhang +4
Convolution-based and Transformer-based vision backbone networks process images into the grid or sequence structures, respectively, which are inflexible for capturing irregular obj…