1 paper · 1 filter
Rana Muhammad Usman, Dominic Williamson
Population-level behavior in large-language-model (LLM) agents cannot be characterized by single-agent benchmarks. We introduce PV-SST, a peer-voted social-platform testbed, and re…