1 paper
Chunhui Zhang, Xin Sun, Yiqian Yang +4
Current mainstream vision-language (VL) tracking framework consists of three parts, \ie a visual feature extractor, a language feature extractor, and a fusion model. To pursue bett…