123 citations · 123 across the 4 of their papers we have counts for
1 paper · 1 filter
Stefan Krsteski, Charlotte Meyer, Guillaume Allegre +2
Comprehensively evaluating AI agents across interactive environments is difficult due to fragmented tasks, scaffolds, verifiers, and scoring rules. Unfortunately, existing efforts…