计算策略模型的偏好差值
对于每个样本,策略模型对 chosen 和 rejected 的对数概率分别为 pi_c 和 pi_r。
实现 DPO(Direct Preference Optimization,直接偏好优化)损失函数。
DPO 无需强化学习即可将语言模型与人类偏好对齐。对于每个样本,给定一对回答:一个是被偏好的回答 chosen,另一个是被拒绝的回答 rejected。
DPO 使用策略模型和参考模型在 chosen / rejected 上的对数概率差值,鼓励策略模型相比参考模型更加偏向 chosen 回答。
损失函数定义如下:
Scan the QR code below with WeChat to sign in
First-time scan will create your account automatically
请使用微信扫描下方二维码完成注册