1 paper · 1 filter
Abhigya Verma, Amit Kumar Saha, Seganrasan Subramanian +1
LLM judges are widely used to evaluate agentic tool-calling systems, yet their reliability on structured, dependency-driven workflows remains largely unexamined. We present AgentJu…