1 paper
Zora Zhiruo Wang, Sanidhya Vijayvargiya, Aspen Chen +7
AI agents are increasingly developed and evaluated on benchmarks relevant to human work, yet it remains unclear how representative these benchmarking efforts are of the labor marke…