1 paper · 1 filter
Jinze Lv, Jian Chen, Zi Long +2
Most existing multimodal machine translation (MMT) datasets are predominantly composed of static images or short video clips, lacking extensive video data across diverse domains an…