1 paper · 1 filter
Leonardo Ranaldi, Sherrie Shen, Jushi Kai +1
Despite the growing use of LLM-powered agents to solve multi-step tasks in complex environments, existing benchmarks rarely test state preservation, performance across languages, a…