Showing cs.AIShow all
2 papers · 1 filter
cs.AI2025
A Benchmark for Scalable Oversight Protocols
Abhimanyu Pallavi Sudhir, Jackson Kaunismaa, Arjun Panickssery
As AI agents surpass human capabilities, scalable oversight -- the problem of effectively supplying human feedback to potentially superhuman AI models -- becomes increasingly criti…
cs.AI2024
Analyzing Probabilistic Methods for Evaluating Agent Capabilities
Axel Højmark, Govind Pimpale, Arjun Panickssery +2
To mitigate risks from AI systems, we need to assess their capabilities accurately. This is especially difficult in cases where capabilities are only rarely displayed. Phuong et al…