1 paper · 1 filter
K. Jack Scott, Narun Pat, Veronica Liesaputra
In this work we investigate how decoder-only transformers resolve lexical ambiguity through layer-by-layer analysis of three models spanning three parameter sizes (GPT-2-Small-117M…