1 paper · 1 filter
Jiang-Tian Zhai, Qi Zhang, Tong Wu +4
Learning fine-grained interplay between vision and language allows to a more accurate understanding for VisionLanguage tasks. However, it remains challenging to extract key image r…