1 paper
Yadang Chen, Wentao Zhu, Zhi-Xin Yang +1
Recently, video object segmentation (VOS) networks typically use memory-based methods: for each query frame, the mask is predicted by space-time matching to memory frames. Despite…