2 papers
cs.AI2026
VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies
Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder +6
Agents deployed in enterprise settings must reason across structured APIs and document collections, yet existing benchmarks evaluate these capabilities in isolation. We introduce V…
cs.AI2025
FLOW-BENCH: Towards Conversational Generation of Enterprise Workflows
Evelyn Duesterwald, Siyu Huo, Vatche Isahagian +7
Business process automation (BPA) that leverages Large Language Models (LLMs) to convert natural language (NL) instructions into structured business process artifacts is becoming a…