1 paper · 1 filter
Babak Barazandeh, Subhabrata Majumdar, George Michailidis
Large language model agents solve tasks by generating trajectories that interleave planning, tool calls, and intermediate results. Current evaluation metrics reduce such a trajecto…