按组计算 reward 均值
rewards 的形状为 B × G,其中每一行对应同一个 prompt 下的 G 个回答。
对每个 prompt 单独计算组内均值:
实现 GRPO(GroupRelativePolicyOptimization,组相对策略优化)损失函数。
GRPO 是大模型强化学习对齐中常用的优化方法。与 PPO 需要为每个值模型估计 advantage 不同,GRPO 会对同一个 prompt 采样多个回答,并使用每组回答的 reward 相对关系来计算 advantage。
给定当前策略模型的对数概率 policy_logps、旧策略模型的对数概率 old_logps、参考模型的对数概率 ref_logps,以及每组回答的奖励 rewards,请你计算 GRPO 损失。
对于每个 prompt 下的 G 个回答,先计算组内归一化 advantage:
Scan the QR code below with WeChat to sign in
First-time scan will create your account automatically
请使用微信扫描下方二维码完成注册