文章详情
LoRA为什么有效? → 微调权重更新是低秩的 LoRA的rank怎么选? → 32默认,简单任务8-16,复杂64 QLoRA比LoRA省多少显存? → 约40-50% SFT数据量多少合适? → 3K-10K高质量 微调后模型变笨怎么办? → 混通用数据+降LR+减少epoch DPO vs RLHF? → DPO简单稳定,RLHF灵活 DPO的beta
3 阅读
请输入邀请码解锁全文内容