Fed-GRPO proposes a federated extension of Group Relative Policy Optimization for LLM fine-tuning, using GRPO's own reward statistics as zero-cost signals to drive aggregation, local training, and communication.…
#FederatedLearning #LLM #RLHF #PrivacyPreservingML
https://arxiv.org/abs/2610.11502
