1 paper
Yuan Gao, Jiangyi Yang, Yao Zhao +1
Evaluating LLM agents in hidden-information multi-agent settings is hard: final outcomes are high-variance and rarely reveal why an agent decided as it did. We study this in a 9-pl…