文章详情
项目:为公司客服系统微调Qwen2-7B Day 1:环境搭建 Day 2-3:数据准备 Day 4-5:LoRA微调 训练结果:Loss从2.1降到0.4,耗时约2小时。 Day 6:DPO对齐 构造1000条偏好数据(好回答vs差回答),进行DPO训练。 Day 7:合并+部署 vLLM Day 8:评估 指标 微调前 微调后 产品问题准确率 45% 9
3 阅读
请输入邀请码解锁全文内容