1 paper
Anling Xiang, Yuwen Yang, Yang Shen
What is the right delay complexity when a learner can track only C pending feedback items and discarded feedback is permanently lost? Existing one-point bandit convex optimizatio…