2 papers
cs.LG2026
ROGUE: Misaligned Agent Behavior Arising from Ordinary Computer Use
Jeremy Tien, Abishek Anand, Yu-Rou Tuan +3
As AI agents are increasingly deployed in real personal and corporate settings (email accounts, development workflows, company databases, etc.), safety considerations surrounding t…
cs.RO2024
Trajectory Improvement and Reward Learning from Comparative Language Feedback
Zhaojing Yang, Miru Jun, Jeremy Tien +3
Learning from human feedback has gained traction in fields like robotics and natural language processing in recent years. While prior works mostly rely on human feedback in the for…