3 papers
cs.AI2026
Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models
Jiyang Guan, Yong Xie, Jun Chen +6
Large language models (LLMs) have demonstrated remarkable capabilities across diverse applications, yet ensuring their simultaneous safety, helpfulness, and trustworthiness remains…
cs.AI2025
MIR: Efficient Exploration in Episodic Multi-Agent Reinforcement Learning via Mutual Intrinsic Reward
Kesheng Chen, Wenjian Luo, Bang Zhang +2
Episodic rewards present a significant challenge in reinforcement learning. While intrinsic reward methods have demonstrated effectiveness in single-agent rein-forcement learning s…
cs.CR2024
Evolutionary Trigger Detection and Lightweight Model Repair Based Backdoor Defense
Qi Zhou, Zipeng Ye, Yubo Tang +3
Deep Neural Networks (DNNs) have been widely used in many areas such as autonomous driving and face recognition. However, DNN model is fragile to backdoor attack. A backdoor in the…