1 paper
Lauri Lovén, Nam Do, Hassan Mehmood +2
We prove that no reinforcement learning policy with confidence-gated autonomy can simultaneously achieve maximum helpfulness, optimal calibration, and full autonomy under rational…