1 paper
Yihang Li, Shuichiro Shimizu, Chenhui Chu +2
Existing multimodal machine translation (MMT) datasets consist of images and video captions or instructional video subtitles, which rarely contain linguistic ambiguity, making visu…