1 paper
Yibo Cui, Liang Xie, Yakun Zhang +3
Cross-modal alignment is one key challenge for Vision-and-Language Navigation (VLN). Most existing studies concentrate on mapping the global instruction or single sub-instruction t…