1 paper
Zihua Wang, Xu Yang, Hanwang Zhang +4
We propose a novel Transformer-based image-to-text generation model termed as \textbf{ACF} that adaptively clusters vision patches into object regions and language words into phras…