3 papers
cs.DC2026
NeMo-DCR: Bit-Exact Delta-Compressed Refit for Scalable Agentic RL at Trillion-Parameter Scale
Songlin Jiang, Zhiyu Li, Terry Kong +5
Agentic reinforcement learning (RL) disaggregates training from rollout, so each policy update must reach the rollout clusters before the next batch. Transferring a full 1T checkpo…
cs.DC2026
Nereus: Adaptive Parallelism for LLM Post-Training
Songlin Jiang, Tuo Shi, Sitong Zhang +3
Reinforcement learning (RL) post-training for large language models (LLMs) coordinates multiple models across generation, inference, and training on GPU clusters. Several factors m…
cs.DC2026
Conduit: An Experience Data Plane for Distributed Reinforcement Learning
Sitong Zhang, Tuo Shi, Mario Di Francesco +2
Distributed reinforcement learning (RL) scales training by parallelizing actors and learners around an Experience Buffer. As RL workloads grow, however, the buffer becomes more tha…