2 papers
cs.CR2026
Learn from Your Mistakes: Tree-like Self-Play for Secure Code LLMs
Wenqi Chen, Ziyan Zhang, Bin Wang +3
While Large Language Models (LLMs) excel in code generation, they remain prone to replicating subtle yet critical vulnerabilities endemic to their training data. Current alignment…
cs.CR2026
Learning to Generate Secure Code via Token-Level Rewards
Jiazheng Quan, Xiaodong Li, Bin Wang +5
Large language models (LLMs) have demonstrated strong capabilities in code generation, yet they remain prone to producing security vulnerabilities. Existing approaches commonly suf…