1 paper · 1 filter
Ruitong Li, Aisheng Mo, Guowei Su +10
AlphaZero is normally evaluated as one agent: a policy-value network fused with Monte Carlo tree search. That fusion hides a causal question. When self-play search is given a usefu…