1 paper
Nishant Mishra, Ameen Abu-Hanna, Iacer Calixto
Linear classifiers trained on hidden states of a large language model (LLM), linear probes, can flag factual errors from a single forward pass. Geometrically, that implies that tru…