赛博牛马
AI 资源导航与内容门户
搜
/
首页
资源
文章
专题
浅色
快速搜索
首页
/
文章
文章
编辑精选与公众号导入
仅展示已发布内容,支持分页浏览。
33.4K+ star 的 多模态 AI Agent 桌面应用:用自然语言控制电脑,字节跳动出品
2026年6月10日
· 15 阅读 · 微信公众平台 · 字节跳动开源的多模态 AI Agent 桌面应用,基于视觉语言模型让 AI 像人类一样操控电脑。只需自然语言指令,即可完成浏览器操作、文件管理、软件设置等复杂任务,支持本地/远程 Operator 开箱即用。
我做了一款 AI 编辑 word 的 skill,推荐给你试试,效果惊艳
2026年6月1日
· 22 阅读 · 微信公众平台 · 总之,这个 skill 最大的价值在于:省却了大量手工排版 word 的时间。
术语表
2026年5月28日
· 28 阅读 · 赛博牛马教程库 · 术语 全称 解释 SFT Supervised Fine-Tuning 监督微调 LoRA Low-Rank Adaptation 低秩适配 QLoRA Quantized LoRA 量化LoRA DPO Direct Preference Optimization 直接偏好优化 RLHF Reinforcement Learning from Human
LLaMA-Factory资源消耗估算器
2026年5月28日
· 15 阅读 · 赛博牛马教程库 · LoRA 0.1% batch=2, seq_len=4096 DeepSpeed ZeRO A100 token
微调数据标注指南
2026年5月28日
· 15 阅读 · 赛博牛马教程库 · 标注规范 指令标注 好的指令应该: 明确具体(“用Python写快速排序”而不是”写个算法”) 包含约束条件(“不超过50字”) 包含输出格式要求(“用JSON格式输出”) 回答标注 好的回答应该: 准确无误 结构清晰 包含示例 长度适中(50-500字) 偏好标注 偏好数据的标注要求: 1. chosen明显好于rejected 2. 好的方面:更准确、更
LLaMA-Factory训练日志详解
2026年5月28日
· 10 阅读 · 赛博牛马教程库 · 日志字段说明 字段 含义 正常范围 loss 训练Loss 持续下降 grad_norm 梯度范数 0.5-5.0 learning_rate 当前学习率 按schedule变化 epoch 当前epoch 0-num_epochs TensorBoard可视化 关键看: 1. train_loss曲线——应该平滑下降 2. eval_loss曲线——不应该
LoRA微调效果不佳时的排查步骤
2026年5月28日
· 7 阅读 · 赛博牛马教程库 · 排查流程 效果不好 快速验证方法 1. 常见效果问题及修复 问题 可能原因 修复 回答格式不对 Template不匹配 检查template 回答全是重复 数据有大量重复 去重+降temperature 回答太短 output数据太短 丰富output内容 回答太长 没有长度控制指令 加”简要回答”类指令 专业知识不够 领域数据太少 增加领域数据 通用能力下
LLaMA-Factory完整项目模板
2026年5月28日
· 7 阅读 · 赛博牛马教程库 · 项目目录结构 训练脚本模板 部署脚本模板
微调后模型上线运维指南
2026年5月28日
· 8 阅读 · 赛博牛马教程库 · 监控指标 指标 告警阈值 监控方式 GPU利用率 <50% 或 >98% nvidia-smi 推理延迟(P99) >5s API日志 错误率 >1% API日志 显存使用 >95% nvidia-smi 吞吐量 <500 t/s 压测工具 日志记录 模型版本管理 回滚方案
LLaMA-Factory性能基准测试
2026年5月28日
· 7 阅读 · 赛博牛马教程库 · 测试环境 GPU: 1x A100-80GB 模型: Qwen2-7B-Instruct 数据: 5000条Alpaca格式 LLaMA-Factory版本: v0.8.0 训练速度对比 配置 速度(tokens/s) 显存 总训练时间 LoRA FP16 2200 28GB 45min LoRA FP16 + FA2 2900 26GB 35min QLo
LLaMA-Factory常见YAML配置错误
2026年5月28日
· 7 阅读 · 赛博牛马教程库 · 错误1:stage和fi netuning_type不匹配 错误2:QLoRA配置遗漏 错误3:dataset名称不匹配 错误4:多数据集配置 错误5:resume路径错误
模型选型与微调策略决策树
2026年5月28日
· 7 阅读 · 赛博牛马教程库 · 选基座模型 主要语⾔是中⽂? 选微调方案 显存多⼤? 选对齐方案 对⻬需求? 选部署方案 部署场景?
模型量化深度解析
2026年5月28日
· 7 阅读 · 赛博牛马教程库 · 量化方法对比 方法 类型 精度损失 速度 推荐场景 GPTQ 训练后量化 INT4:5-10% 快 GPU推理 AWQ 训练后量化 INT4:3-8% 最快 GPU推理(推荐) SmoothQuant 训练后量化 INT8:<2% 快 高精度需求 GGUF 训练后量化 Q4_K_M:5-12% CPU可用 CPU/边缘推理 QAT 量化感知训练
RLHF训练深度解析
2026年5月28日
· 6 阅读 · 赛博牛马教程库 · PPO算法详解 PPO(Proximal Policy Optimization)是RLHF使用的核心算法。 四个模型 模型 大小 作用 训练 Actor 7B 生成回复 是 Critic 7B 估计状态价值 是 RM 7B 给回复打分 否 Ref 7B 参考策略 否 总显存:4 * 7B * 2bytes = 56GB(FP16),加上梯度和优化器更多。
DPO训练深度解析
2026年5月28日
· 6 阅读 · 赛博牛马教程库 · DPO的数学原理 DPO的核心洞察:RLHF的最优策略有解析解。 从RLHF的目标函数出发,可以推导出: pi ref(y|x) * exp(r(x,y)/beta) 其中Z(x)是归一化常数。反解出奖励函数: r(x,y) = beta * log(pi(y|x)/ref(y|x)) + beta * log(Z(x)) 将此代入Bradley-Terry
SFT训练Loss深度解析
2026年5月28日
· 6 阅读 · 赛博牛马教程库 · 正常的Loss曲线 正常特征: - 初期快速下降(0-500步) - 中期稳步下降(500-1500步) - 后期缓慢收敛(1500步+) -验证Loss比训练Loss稍高 异常Loss曲线分析 Loss不降 可能原因: 1. LR太小(<1e-6)→ 增大到2e-4 2. 数据格式错误 → 检查template和数据格式 3. rank太小→
LLaMA-Factory社区资源
2026年5月28日
· 6 阅读 · 赛博牛马教程库 · 官方资源 GitHub: https://github.com/hiyouga/LLaMA-Factory 文档: https://llamafactory.readthedocs.io 问题反馈: GitHub Issues 社区模型 HuggingFace: 大量微调模型可供参考 ModelScope: 国内模型托管 学习资源 LLaMA-Factory
微调项目时间估算
2026年5月28日
· 6 阅读 · 赛博牛马教程库 · 7B模型时间估算 阶段 QLoRA(1卡24GB) LoRA(1卡80GB) 全量(4卡80GB) 数据准备 2-5天 2-5天 2-5天 训练(5K数据) 2-3小时 1-2小时 1-2小时 评估 0.5天 0.5天 0.5天 DPO(1K偏好) 1-2小时 0.5-1小时 0.5-1小时 合并+部署 0.5天 0.5天 0.5天 总计 4-7天 4-7天
微调踩坑大全(50个坑)
2026年5月28日
· 6 阅读 · 赛博牛马教程库 · 数据相关(20个坑) 数据全是简单问题→ 模型只会答简单题 拒答数据太多(>30%) → 模型过于保守 多轮对话from字段写反→模型学用户说话 数据没去重 → 浪费训练步数 数据格式不匹配template → 输出乱码 instruction太短(<5字) → 任务不明确 output太短(<10字) → 无信息量
LLaMA-Factory最新功能
2026年5月28日
· 6 阅读 · 赛博牛马教程库 · v0.8+新功能 KTO支持:只需好/坏标签的偏好学习 ORPO支持:SFT+对齐一步完成 SimPO支持:无需参考模型的偏好优化 LoRA+支持:A和B使用不同学习率 rsLoRA支持:秩稳定LoRA 多模态训练:LLaVA风格视觉语言模型 Galore优化器:新的参数高效优化方法 BAdam优化器:内存高效的块坐标优化 如何升级 升级后检查: - dat
第 1 / 21 页
下一页