赛博牛马
AI 资源导航与内容门户
搜
/
首页
资源
文章
专题
浅色
快速搜索
首页
/
文章
文章
编辑精选与公众号导入
仅展示已发布内容,支持分页浏览。
LLaMA-Factory Web UI操作图文指南
2026年5月28日
· 5 阅读 · 赛博牛马教程库 · 启动 llamafactory-cli webui 打开浏览器访问 http://localhost:7860 界面布局 LlamaBoard包含4个主要页面: Train(训练):配置并启动训练 Evaluate(评估):运行评估任务 Chat(聊天):交互测试模型 Export(导出):合并和导出模型 训练页面操作 选择模型名称和路径 选择训练阶段(SF
LLaMA-Factory技巧与小窍门
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 技巧1:快速验证数据格式 技巧2:多实验管理 技巧3:混合精度选择 技巧4:预加载数据到内存 技巧5:断点续训 技巧6:LoRA目标层精细控制 lora_target: all lora_target: q_proj,k_proj,v_proj,o_proj,gate_proj,up_proj,down_proj 技巧7:训练时动态调整超参 cosine +
微调后模型效果对比实验
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · 实验设置 基座模型:Qwen2-7B-Instruct 任务:中文客服问答 评估指标:准确率、格式正确率、安全性 实验1:LoRA vs QLoRA vs 全量微调 方法 显存 训练时间 准确率 格式正确率 全量微调 84GB(4卡) 3h 92% 98% LoRA(r=32) 28GB(1卡) 1.5h 89% 97% LoRA(r=64) 30GB(1卡
大模型微调常见数据集
2026年5月28日
· 5 阅读 · 赛博牛马教程库 · 通用指令数据集 数据集 语言 规模 质量 用途 Alpaca_zh 中文 5万 中 中文指令跟随 BELLE_zh 中文 200万 中 中文对话 MOSS_zh 中文 115万 中高 中文多轮对话 Firefly_zh 中文 16万 中 中文指令 Alpaca_en 英文 5万 中 英文指令 Open-Orca 英文 423万 中 英文指令 SlimOrca
LoRA微调数学原理详解
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 为什么LoRA有效 原始微调: LoRA的假设:delta_W是低秩的,可以分解为delta_W = B*A 证明直觉:1.预训练模型已经学到了大部分知识 2.微调只需要少量调整 3. 调整本身可以用低秩矩阵近似4.实验验证:微调的delta_W的奇异值衰减很快,确实低秩 数学推导 给定输入x,原始前向传播: y = Wx LoRA前向传播: 其中: - W
LLaMA-Factory源码解读
2026年5月28日
· 5 阅读 · 赛博牛马教程库 · 训练入口 src/train.py 2. 3. stage 4. 5. 数据处理流程 src/data/parser.py 2. 3. formatting 4. template 5. padding Template处理 理解源码有助于排查template和数据格式问题。
5个真实微调项目实战详解
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 项目1:电商客服微调 背景:某电商平台日咨询量10万+,人工客服成本高,需要AI客服处理常见问题。 方案: - 基座模型:Qwen2-7B-Instruct - 训练方案:QLoRA (4-bit) - 数据:8000条客服对话(5个品类各1600条) 数据构造过程: 训练配置: 结果: | 指标 | 微调前 | 微调后 | |——|——–|——–| | 产
微调项目Checklist模板
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 项目启动 明确微调目标(什么任务、什么效果指标) 选择基座模型 确认GPU资源 制定数据收集计划 数据阶段 收集原始数据 数据清洗(去重+过滤+质量评估) 格式转换(Alpaca/ShareGPT) 注册数据集 抽样检查50条数据质量 训练阶段 确定训练方案(LoRA/QLoRA/全量) 编写YAML配置 小规模测试(100条数据训练1步) 正式训练 监控L
常见面试题:微调方向
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · LoRA为什么有效? → 微调权重更新是低秩的 LoRA的rank怎么选? → 32默认,简单任务8-16,复杂64 QLoRA比LoRA省多少显存? → 约40-50% SFT数据量多少合适? → 3K-10K高质量 微调后模型变笨怎么办? → 混通用数据+降LR+减少epoch DPO vs RLHF? → DPO简单稳定,RLHF灵活 DPO的beta
LLaMA-Factory vs 其他框架对比
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 特性 LLaMA-Factory Axolotl HuggingFace原生 Unsloth 学习曲线 低 中 高 低 配置方式 YAML YAML Python代码 Python代码 SFT 支持 支持 需自己写 支持 DPO 支持 支持 需DPOTrainer 支持 RLHF/PPO 支持 支持 需TRL 不支持 Web UI 有 无 无 有(Colab
显存需求速查表
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · SFT训练显存 模型 QLoRA(4bit) LoRA(FP16) 全量(FP16) 1.5B 6GB 8GB 12GB 7B 16GB 28GB 84GB 13B 24GB 48GB 156GB 34B 48GB 96GB 408GB 70B 80GB 160GB 840GB DPO训练显存 DPO需要同时加载参考模型,显存约为SFT的1.5倍: 模型 Q
常用模型Template对照表
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 模型 template值 对话格式示例 Qwen/Qwen2 qwen <\\|im_start\|>system\n{system}<\\|im_end\|>\n<\\|im_start\|>user\n{user}<\\|im_end\|>\n
LLaMA-Factory命令行速查
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · > 正文为语雀 Lake 格式。使用 --download-images 可生成带本地图片路径的 Markdown。 <!doctype lake><meta name="doc-version" content="1" /><meta name="viewport" content="fixed" /><meta
LLaMA-Factory YAML配置速查
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · SFT配置 DPO配置 RLHF配置 Step 1: RM Step 2: PPO 导出配置 LoRA (AWQ)
微调各阶段最佳实践总结
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · SFT阶段 要素 最佳实践 常见错误 数据量 3K-10K高质量 追求10万+低质量 数据质量 人工审核+清洗 只用AI生成不审核 数据格式 严格匹配template 格式混乱 LR 2e-4(LoRA) 1e-3太大 Epochs 2-3 5-10过拟合 Rank 32(默认) 4太小 Loss mask 只对response算 对全部算 DPO阶段 要素
微调效果不佳的排查清单
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 当微调效果不好时,按此清单逐项排查: 数据问题(最常见,占70%) 数据量够吗?(至少3000条) 数据质量高吗?(人工抽样检查50条) 去重了吗?(重复数据浪费训练步数) 格式正确吗?(Alpaca/ShareGPT字段完整) 难度分布合理吗?(简单/中等/困难3:5:2) 有没有全是简单问题的坑?(加中等和困难数据) 拒答数据太多吗?(&lt;1
LLaMA-Factory与HuggingFace原生训练对比
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 代码量对比 HuggingFace 150 LoRA LLaMA-Factory YAML A 功能对比 功能 HuggingFace原生 LLaMA-Factory SFT 需自己写代码 YAML配置 DPO 需DPOTrainer stage: dpo RLHF/PPO 需TRL库 stage: ppo 数据加载 需自己写 dataset_info.js
从LoRA到生产部署完整流水线
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 流水线总览 数据准备 → 2. LoRA训练 → 3. 评估 → 4. DPO对⻬ → 5. 合并导出 → 6. 量化 → 7. 部署 自动化脚本 #!/bin/bash set -e MODEL_PATH=&quot;./models/Qwen2-7B-Instruct&quot; DATASET=&quot;customer_se
LLaMA-Factory训练排错手册
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 常见错误及解决方案 错误1:RuntimeError: Expected all tensors to be on the same device 原因:模型和数据在不同设备上 解决: 确保没有⼿动.to(device)操作 检查deepspeed配置是否正确 升级LLaMA-Factory到最新版 错误2:UnboundLocalError: cannot
模型推理性能优化
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · vLLM性能调优 vLLM性能参考(7B模型,A100-80GB) 配置 吞吐量(tokens/s) 延迟(P50) 单卡基础 2000-3000 50ms 单卡优化 4000-5000 40ms 2卡TP 7000-9000 35ms KV Cache优化 KV Cache vLLM 0.4+ --kv-cache-dtype fp8_e5m2 # FP8
上一页
第 2 / 21 页
下一页