文章详情
近年来,大语言模型(LLM)微调领域持续探索更高效的方法。传统 RLHF 需先训练奖励模型,再用强化学习优化模型策略,流程复杂且计算资源消耗大。尽管PPO非常成功,但是RLHF中的PPO非常复杂,要同时维护和训练多个模型,包括策略模型、奖励模型、价值模型和SFT参考模型。DPO(Direct Preference Optimization)作为一种新兴技术,
4 阅读
请输入邀请码解锁全文内容