1 paper · 1 filter
Jie Jiang, Yusen Huo, Yangru Huang +3
Off-policy policy optimization reuses historical behavior, including negative-advantage samples that suppress known failures. We show that repeated reuse can turn this useful signa…