2 papers
cs.CL2024
Context versus Prior Knowledge in Language Models
Kevin Du, Vésteinn Snæbjarnarson, Niklas Stoehr +3
To answer a question, language models often need to integrate prior knowledge learned during pretraining and new information presented in context. We hypothesize that models perfor…
cs.CL2024
A Transformer with Stack Attention
Jiaoda Li, Jennifer C. White, Mrinmaya Sachan +1
Natural languages are believed to be (mildly) context-sensitive. Despite underpinning remarkably capable large language models, transformers are unable to model many context-free l…