1 paper · 1 filter
Houcheng Jiang, Boxuan Zhang, Qiyong Zhong +3
Safeguarding language model agents requires assessing complete execution trajectories under context-dependent safety policies. Existing policy-aware safeguards mainly rely on promp…