2 papers
cs.LG2026
FedMOA: Federated GRPO for Personalized Reasoning LLMs under Heterogeneous Rewards
Ziyao Wang, Daeun Jung, Yexiao He +4
Group Relative Policy Optimization (GRPO) has recently emerged as an effective approach for improving the reasoning capabilities of large language models through online multi-objec…
cs.CR2025
Prada: Black-Box LLM Adaptation with Private Data on Resource-Constrained Devices
Ziyao Wang, Yexiao He, Zheyu Shen +4
In recent years, Large Language Models (LLMs) have demonstrated remarkable abilities in various natural language processing tasks. However, adapting these models to specialized dom…