1 paper
Sadia Kamal, Arefa Patwary, Anthony Marchiafava +2
Survey-style evaluations of large language models often treat a prompted response as a measure of a model's values or beliefs. This assumption is particularly fragile when response…