1 paper
Hyunjun Kim, Sooyoung Ryu
As agentic AI systems increasingly operate autonomously, establishing trust through verifiable evaluation becomes critical. Yet existing benchmarks lack the transparency and audita…