1 paper
Sungjin Park, Edward Choi
Transformer-based models have significantly improved performance across a range of multimodal understanding tasks, such as visual question answering and action recognition. However…