2 papers
cs.LG2026
DECA: Decentralizing Block-Wise Adam for Efficient LLM Full-Parameter Fine-Tuning on Non-IID Data
Yunsheng Yuan, Shaowei Li, Kai Wang +5
Fine-tuning large language models (LLMs) in privacy-sensitive and resource-constrained environments remains challenging. Since training data are often distributed across multiple c…
cs.LG2026
FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data
Pengyu Chen, Shaowei Li, Kai Wang +4
Recent advances in language models have established reinforcement learning as the primary paradigm for eliciting self-correction and long-chain reasoning. While group relative poli…