文章详情
PPO算法详解 PPO(Proximal Policy Optimization)是RLHF使用的核心算法。 四个模型 模型 大小 作用 训练 Actor 7B 生成回复 是 Critic 7B 估计状态价值 是 RM 7B 给回复打分 否 Ref 7B 参考策略 否 总显存:4 * 7B * 2bytes = 56GB(FP16),加上梯度和优化器更多。
6 阅读
请输入邀请码解锁全文内容