文章详情
随着大模型能力不断提升,单纯依赖监督微调难以满足复杂的人类偏好需求。强化学习,尤其是 PPO(Proximal Policy Optimization),成为调优模型生成行为、提升输出质量和对齐性的关键技术。 一、PPO 背景与意义 强化学习通过奖励信号优化策略,适合训练生成模型以符合复杂目标。然而传统强化学习算法如 TRPO 复杂难调,训练不稳定。 PPO
4 阅读
请输入邀请码解锁全文内容