1 paper · 1 filter
Netta Madvil, Gilad Dym, Alon Mecilati +12
AI agents execute complex multi-step processes, but current evaluation falls short: outcome metrics report success or failure without explaining why, and process-level approaches s…