1 paper
Danqing Wang, Akshay Sivaraman, Lei Li
Evaluating LLM agents in realistic service scenarios requires complex task dependencies, imperfect user behavior, and an evaluation that accommodates multiple valid solutions. We i…