1 paper
Danlong Yuan, Wei Wu, Enhan Zhao +4
Reinforcement learning (RL) has become a key paradigm for training software engineering (SWE) agents, but existing pipelines typically rely on per-task containers for isolation. At…