1 paper · 1 filter
Johannes Kirmayr, Lukas Stappen, Elisabeth André
Existing benchmarks for Large Language Model (LLM) agents focus on task completion under idealistic settings but overlook reliability in real-world, user-facing applications. In do…