Showing cs.AIShow all
3 papers · 1 filter
cs.AI2026
FinalityBench: An Effect-Level Benchmark for Agent Decisions Under Delayed and Conflicting Financial Finality
Abhishek Sharma
A merchant's payment processor, ledger, ERP and bank feed are updated by messages that get delayed, duplicated, dropped and reordered, so for minutes at a time the four hold contra…
cs.AI2026
BADGER: Bridging Agentic and Deterministic Evaluation for Generative Enterprise Reasoning
Shannon Serrao, Soumitra Chatterjee, Dorina Strori +2
Enterprise AI systems that translate natural language into SQL queries and orchestrate multi-step agentic reasoning pipelines require evaluation approaches fundamentally different…
cs.AI2016
Controlling Search in Very large Commonsense Knowledge Bases: A Machine Learning Approach
Abhishek Sharma, Michael Witbrock, Keith Goolsbey
Very large commonsense knowledge bases (KBs) often have thousands to millions of axioms, of which relatively few are relevant for answering any given query. A large number of irrel…