Showing cs.AIShow all
2 papers · 1 filter
cs.AI2026
Safety Must Precede the Deployment of Open-Ended AI
Ivaxi Sheth, Jan Wehner, Sahar Abdelnabi +2
AI advancements have been significantly driven by a combination of foundation models and curiosity-driven learning aimed at increasing capability and adaptability. Within this land…
cs.AI2024
Explaining Learned Reward Functions with Counterfactual Trajectories
Jan Wehner, Frans Oliehoek, Luciano Cavalcante Siebert
Learning rewards from human behaviour or feedback is a promising approach to aligning AI systems with human values but fails to consistently extract correct reward functions. Inter…