1 paper
Xuejiao Tang, Xin Huang, Wenbin Zhang +4
Visual Commonsense Reasoning (VCR) predicts an answer with corresponding rationale, given a question-image input. VCR is a recently introduced visual scene understanding task with…