文章详情
DPO的数学原理 DPO的核心洞察:RLHF的最优策略有解析解。 从RLHF的目标函数出发,可以推导出: pi ref(y|x) * exp(r(x,y)/beta) 其中Z(x)是归一化常数。反解出奖励函数: r(x,y) = beta * log(pi(y|x)/ref(y|x)) + beta * log(Z(x)) 将此代入Bradley-Terry
6 阅读
请输入邀请码解锁全文内容