文章详情
7.1 为什么需要对齐 SFT模型存在的问题:-可能生成有害内容- 回答可能不诚实 -可能不帮忙(拒答合理问题) 对齐的目标:让模型做到3H— —Helpful、Honest、Harmless。 7.2 RLHF三步走 7.3 奖励模型训练 数据格式 第一个gpt回复是chosen(好),第二个是rejected(差)。 RM训练配置 RM训练注意事项 只训
3 阅读
请输入邀请码解锁全文内容