赛博牛马
AI 资源导航与内容门户
搜
/
首页
资源
文章
专题
浅色
快速搜索
首页
/
文章
文章
编辑精选与公众号导入
仅展示已发布内容,支持分页浏览。
SFT数据集构造进阶
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 用大模型生成训练数据 注意事项: 1. 必须人工审核所有AI生成数据 2. 生成温度要高(0.7-0.9),确保多样性 3. 回答温度要低(0.2-0.3),确保准确性4.混入20-30%人工编写数据 多语言数据构造 领域数据构造流水线 收集领域⽂档(PDF/⽹⻚/数据库) 提取关键知识三元组(实体-关系-实体) 基于知识三元组⽣成问答对 ⼈⼯审核+修正 格
SFT训练深度调参指南
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 学习率选择 学习率是最关键的超参数。 微调方式 推荐LR 范围 LoRA 2e-4 1e-4 ~ 5e-4 QLoRA 2e-4 1e-4 ~ 5e-4 全量微调 5e-6 1e-6 ~ 2e-5 DPO 5e-7 1e-7 ~ 5e-6 PPO 1e-6 5e-7 ~ 5e-6 继续预训练 5e-5 1e-5 ~ 1e-4 LR太大症状:Loss震荡不收敛
LLaMA-Factory版本更新与兼容性
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 版本选择 版本 推荐场景 注意 最新版(v0.8+) 新项目 功能最全 v0.6.x 稳定优先 长期验证 v0.5.x 旧项目兼容 部分新功能缺失 升级注意事项 dataset_info.json格式可能有变化 YAML配置字段可能增减 模型template可能更新 先在新环境测试,再替换生产 常见兼容性问题 新版改了默认template → 检查训练配置
从零到一完整实战案例
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 项目:为公司客服系统微调Qwen2-7B Day 1:环境搭建 Day 2-3:数据准备 Day 4-5:LoRA微调 训练结果:Loss从2.1降到0.4,耗时约2小时。 Day 6:DPO对齐 构造1000条偏好数据(好回答vs差回答),进行DPO训练。 Day 7:合并+部署 vLLM Day 8:评估 指标 微调前 微调后 产品问题准确率 45% 9
LLaMA-Factory常见问题FAQ
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · Q1:LLaMA-Factory支持哪些模型? A:100+模型,包括Qwen、LLaMA、Mistral、DeepSeek、Yi、ChatGLM、Baichuan等主流模型。完整列表见README。 Q2:Mac M系列芯片能训练吗? A:可以,但有限制。QLoRA不支持(bitsandbytes不支持MPS),只能用LoRA(FP16)。M2 Max 3
模型评估完整指南
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 自动评估工具 lm-eval-harness FastChat评估 人工评估框架 A/B测试 微调模型vs原始模型的对比测试:
常见训练场景最佳实践
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 场景1:客服问答微调 数据要点: - 每个产品类别500-1000条 - 包含多轮对话 - Loss mask只对assistant回复计算 场景2:代码生成微调 数据要点: - 每种编程语言2000-5000条 - 包含函数签名+实现+注释 - 混入代码解释数据 场景3:文档摘要微调 场景4:情感分析微调 场景5:多语言翻译微调
LoRA高级配置
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · LoRA+(新方法) LoRA+对A和B使用不同的学习率,B的学习率是A的16倍: 效果:相同训练时间下比标准LoRA效果好2-5%。 rsLoRA(秩稳定LoRA) 用alpha/sqrt(rank)替代alpha/rank作为缩放因子: rsLoRA的优势:大rank时更稳定,不会因为rank增大而过度缩放。 DoRA(权重分解LoRA) 将权重分解为幅
SFT数据增强技巧
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · 技巧1:Self-Instruct 用强模型生成训练数据: 指令类型:{category} 难度:{difficulty} 要求: 回答要专业准确 包含具体示例 50-200字 指令:{instruction}""" 技巧2:数据改写 对已有数据进行改写增加多样性: 技巧3:难度分层 确保数据覆盖不同难度
LLaMA-Factory训练完整Checklist
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 训练前检查 CUDA版本和PyTorch匹配 模型已正确下载 Template和模型匹配 数据集已注册到dataset_info.json 数据格式正确(Alpaca/ShareGPT) 数据已清洗(去重、长度过滤) 显存够用(参考显存计算器) 磁盘空间够存checkpoint 训练中监控 Loss持续下降 GPU利用率>80% 无OOM、Na
模型Template完全指南
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · LLaMA-Factory使用template来确保对话格式正确。template不匹配是最常见的训练问题之一。 支持的Template 模型 template名 特殊标记 Qwen系列 qwen <|im_start|><|im_end|> LLaMA-2 llama2 [INST]<
LLaMA-Factory Web UI (LlamaBoard)
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 启动Web UI llamafactory-cli webui 浏览器打开 http://localhost:7860 功能概览 训练页:可视化配置训练参数,支持SFT/DPO/RLHF 评估页:运行评估任务 聊天页:测试模型效果 导出页:合并LoRA权重、量化导出 什么时候用Web UI 快速实验和调试 不熟悉YAML配置的新手 需要可视化监控训练过程 什
LLaMA-Factory数据集注册完全指南
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · dataset_info.json详解 LLaMA-Factory通过dataset_info.json管理数据集。文件位于data/dataset_info.json。 注册自定义数据集的步骤 将数据文件放入data/目录 在dataset_info.json中添加条目 在YAML配置中用dataset字段引用 数据格式转换 内置数据集 LLaMA-Fac
LLaMA-Factory vs Axolotl
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 特性 LLaMA-Factory Axolotl 易用性 高(YAML配置) 中(YAML+代码) 灵活性 中 高 模型覆盖 100+ 50+ RLHF/DPO 支持 支持 Web UI 有 无 社区 大(30K stars) 中(8K stars) 适合 大多数用户 高级用户 推荐:大多数场景用LLaMA-Factory。需要更细粒度控制时考虑Axolot
训练日志解读
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · 正常日志模式 正常特征:Loss持续下降,Speed稳定,GPU>80% 异常日志模式 Loss飙升后恢复→数据中有异常样本,跳过即可 Loss不降反升 →LR太大或数据有问题GPU利用率<50% → 数据加载是瓶颈,用preload_to_memory Speed越来越慢 → 显存碎片,重启训练
显存计算器
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · > 正文为语雀 Lake 格式。使用 --download-images 可生成带本地图片路径的 Markdown。 <!doctype lake><meta name="doc-version" content="1" /><meta name="viewport" content="fixed" /><meta
常见报错速查表
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 报错 原因 解决 CUDA out of memory 显存不够 减batch/开gradient_checkpointing/用QLoRA Loss is NaN LR太大或数据异常 降LR到1e-5/清洗数据 RuntimeError: shape mismatch 模板不匹配 检查template是否和模型对应 KeyError: ‘xxx’ in d
附录内容
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · > 正文为语雀 Lake 格式。使用 --download-images 可生成带本地图片路径的 Markdown。 {}
进阶技巧
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · 12.1 多任务微调 同时微调多个任务,注意数据配比: 配比建议: - 主任务60-70% - 辅助任务20-30% - 通用数据10% 或者用独立LoRA适配器,推理时按需加载。 12.2 长上下文微调 默认模型上下文4K,如果需要更长: 注意:cutoff_len翻倍,显存消耗也翻倍。7B模型8K上下文QLoRA约需24GB。 12.3 继续预训练 在领
推理部署
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 11.1 vLLM部署微调模型 vLLM是当前最推荐的生产级推理方案。 vLLM vLLM关键参数 参数 推荐值 说明 gpu-memory-utilization 0.85-0.90 不要设100%会OOM max-model-len 4096/8192 根据需求设,太大占显存 dtype auto 自动选择BF16/FP16 tensor-paralle
上一页
第 3 / 21 页
下一页