文章详情
8.1 DPO vs RLHF 维度 RLHF(PPO) DPO 流程 SFT+RM+PPO三步 SFT+DPO两步 需要RM 是 否 稳定性 不稳定 稳定 效果 灵活 大多数场景够用 显存 需4个模型 只需2个模型 推荐度 高级用户 默认选择 结论:除非你有特殊需求(自定义奖励信号),否则优先用DPO。 8.2 DPO数据格式 与RM数据格式相同:第一个g
3 阅读
请输入邀请码解锁全文内容