1 paper
Asher Labovich, Benjamin Bradley, Vanessa Alexander +1
Encoder-decoder models offer substantial inference-time savings over decoder-only models, but their pretraining objectives suffer from sparse supervision and dynamic sequence lengt…