3 papers
cs.LG2025
Contextual Bandits in Payment Processing: Non-uniform Exploration and Supervised Learning
Akhila Vangara, Alex Egg
Uniform random exploration in decision-making systems supports off-policy learning via supervision but incurs high regret, making it impractical for many applications. Conversely,…
cs.LG2025
DABstep: Data Agent Benchmark for Multi-step Reasoning
Alex Egg, Martin Iglesias Goyanes, Friso Kingma +3
We introduce DABstep, a novel benchmark for evaluating AI agents on realistic multi-step data analysis tasks. DABstep comprises over 450 real-world challenges derived from a financ…
cs.LG2025
Off-policy Evaluation for Payments at Adyen
Alex Egg
This paper demonstrates the successful application of Off-Policy Evaluation (OPE) to accelerate recommender system development and optimization at Adyen, a global leader in financi…