文章详情
在大语言模型(LLM)的训练与对齐过程中,如何在保证模型性能的同时提升训练效率,一直是学界和工业界关注的焦点。常见的方法有 PPO(Proximal Policy Optimization) 和 DPO(Direct Preference Optimization),但它们各自也有一些局限性。最近提出的 GRPO(Group Relative Policy
4 阅读
请输入邀请码解锁全文内容