1 paper
Chengguang Gan, Yunhao Liang, QingHao Zhang +1
Web agents are usually evaluated in live environments, where environment state and judge models drift between runs, so the same checkpoint rarely reproduces the same score, making…