1 paper
Dan Malkin, Tomasz Limisiewicz, Gabriel Stanovsky
We show that the choice of pretraining languages affects downstream cross-lingual transfer for BERT-based models. We inspect zero-shot performance in balanced data conditions to mi…