1 paper · 1 filter
Yaya Sy, Christophe Cerisara, Irina Illina
Pruning large pre-trained transformers in a data-scarce scenario is challenging, as it often requires massive retraining data to recover performance. For instance, Distill-Whisper…