2 papers
cs.LG2026
GAC: Stabilizing Asynchronous RL Training for LLMs via Gradient Alignment Control
Haofeng Xu, Junwei Su, Yukun Tian +3
Asynchronous execution is essential for scaling reinforcement learning (RL) to modern large model workloads, including large language models and AI agents, but it can fundamentally…
cs.CL2025
Feature-Aware Malicious Output Detection and Mitigation
Weilong Dong, Peiguang Li, Yu Tian +3
The rapid advancement of large language models (LLMs) has brought significant benefits to various domains while introducing substantial risks. Despite being fine-tuned through rein…