1 paper
Linhui Xiao, Xiaoshan Yang, Fang Peng +2
Constrained by the separate encoding of vision and language, existing grounding and referring segmentation works heavily rely on bulky Transformer-based fusion en-/decoders and a v…