1 paper
Heegon Jin, Seonil Son, Jemin Park +3
The advent of scalable deep models and large datasets has improved the performance of Neural Machine Translation. Knowledge Distillation (KD) enhances efficiency by transferring kn…