1 paper
Rebecca Ansell, Autumn Toney-Wails
Deducing whodunit proves challenging for LLM agents. In this paper, we implement a text-based multi-agent version of the classic board game Clue as a rule-based testbed for evaluat…