1 paper
K. Jack Scott, Narun Pat, Veronica Liesaputra
In this work we investigate how decoder-only transformers resolve lexical ambiguity through layer-by-layer analysis of three models spanning three parameter sizes (GPT-2-Small-117M…