1 paper
Alexander Yom Din, Taelin Karidi, Leshem Choshen +1
Transformer-based language models create hidden representations of their inputs at every layer, but only use final-layer representations for prediction. This obscures the internal…