1 paper
Junbo Wang, Liangyu Fu, Yuke Li +4
Current video captioning methods usually use an encoder-decoder structure to generate text autoregressively. However, autoregressive methods have inherent limitations such as slow…