3 papers
cs.CR2026
BraveGuard: From Open-World Threats to Safer Computer-Use Agents
Yunhao Feng, Xiaohu Du, Xinhao Deng +13
Computer-use agents extend language models from text generation to sustained interaction with files, terminals, browsers, and external tools. This shift creates safety risks that a…
cs.LG2026
PACE: Parameter Change for Unsupervised Environment Design
Fang Yuan, Quanjun Yin, Siqi Shen +5
Unsupervised Environment Design (UED) offers a promising paradigm for improving reinforcement learning generalization by adaptively shaping training environments, but it requires r…
cs.LG2025
Learning from Peers: Collaborative Ensemble Adversarial Training
Li Dengjin, Guo Yanming, Xie Yuxiang +4
Ensemble Adversarial Training (EAT) attempts to enhance the robustness of models against adversarial attacks by leveraging multiple models. However, current EAT strategies tend to…