赛博牛马
AI 资源导航与内容门户
搜
/
首页
资源
文章
专题
浅色
快速搜索
首页
/
文章
文章
编辑精选与公众号导入
仅展示已发布内容,支持分页浏览。
模型合并与导出
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 10.1 LoRA权重合并 训练完成后的LoRA权重需要合并回基础模型才能独立使用。 合并原理:W_new = W + (alpha/rank) * B * A 合并后模型与原始模型格式相同,可以像原始模型一样使用。 10.2 量化导出 GPTQ量化 GPTQ需要校准数据集来计算量化参数,约128条即可。 AWQ量化 AWQ vs GPTQ: - AWQ更快
多模态微调
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 9.1 视觉语言模型微调 LLaMA-Factory支持LLaVA风格的视觉语言模型微调。 数据格式 配置 9.2 图文数据准备 数据量建议: - 场景识别:5000-10000对 - OCR:10000+对 - 图表理解:3000-5000对 - 医学影像:需要领域专家标注 数据质量要求: - 图片分辨率不要太低(至少224x224) - 描述要准确具体,
DPO对齐训练
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 8.1 DPO vs RLHF 维度 RLHF(PPO) DPO 流程 SFT+RM+PPO三步 SFT+DPO两步 需要RM 是 否 稳定性 不稳定 稳定 效果 灵活 大多数场景够用 显存 需4个模型 只需2个模型 推荐度 高级用户 默认选择 结论:除非你有特殊需求(自定义奖励信号),否则优先用DPO。 8.2 DPO数据格式 与RM数据格式相同:第一个g
RLHF对齐训练
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 7.1 为什么需要对齐 SFT模型存在的问题:-可能生成有害内容- 回答可能不诚实 -可能不帮忙(拒答合理问题) 对齐的目标:让模型做到3H— —Helpful、Honest、Harmless。 7.2 RLHF三步走 7.3 奖励模型训练 数据格式 第一个gpt回复是chosen(好),第二个是rejected(差)。 RM训练配置 RM训练注意事项 只训
全量微调
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 6.1 什么时候需要全量微调 大多数场景LoRA/QLoRA就够了。以下情况考虑全量微调: 任务非常复杂(如多语言翻译+代码生成+推理) 数据量很大(>100K条) 需要最强的效果 有充足的GPU资源 6.2 DeepSpeed ZeRO配置 6.3 DeepSpeed ZeRO三级对比 级别 切分内容 显存节省 通信开销 推荐场景 ZeRO-
QLoRA微调实战
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 5.1 QLoRA与LoRA的区别 QLoRA = 4-bit量化 + LoRA。 维度 LoRA QLoRA 模型精度 FP16/BF16 4-bit(NF4) 显存(7B) 28GB 16GB 训练速度 快 较慢(约慢15-20%) 效果 最好 接近LoRA(差距<2%) 什么时候用QLoRA? - 显存不够跑LoRA时(如24GB卡跑7B
LoRA微调实战
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 4.1 LoRA原理速览 LoRA(Low-Rank Adaptation)的核心假设:微调的权重更新是低秩的。 原始权重W[d,d],LoRA将其分解为:W_new = W + B*A,其中B[d,r] A[r,d],r远小于d。 以7B模型为例:-原始参数:d=4096,单个线性层参数量40964096*16=131K,仅为原参数的0.8% - 全模型可
数据准备
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 数据质量决定微调上限。这一章是最重要的章节,没有之一。 3.1 Alpaca格式 字段说明: - instruction :任务指令(必填) - input :补充输入(可选,可为空字符串) -output :期望输出(必填) 什么时候用input字段? instruction放任务描述,input放具体内容。如果instruction本身就足够清晰,inp
环境准备
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 2.1 硬件要求 模型大小 QLoRA(4-bit) LoRA(FP16) 全量微调 1.5B 6GB 8GB 12GB 7B 16GB 28GB 80GB+ 13B 24GB 48GB 160GB+ 70B 80GB 160GB 640GB+ 推荐配置: 入门:单张RTX 3090/4090 (24GB),QLoRA跑7B 中等:单张A100-80GB,L
为什么要微调?
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 前言:微调不是玄学,是工程 你下载了一个7B的开源模型,问它公司业务问题,回答全是不着边际的废话。你听说LoRA能微调,搜了篇教程,跟着跑了一遍,Loss是降了,但模型回答还是不对味。 问题不在LoRA,在你的数据和流程。 这本手册不做概念科普,专注一件事:用LLaMA-Factory把微调这件事做对。从数据准备到训练调参到部署上线,每一步都有具体参数、踩坑
大模型微调实战 知识库
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · > 正文为语雀 Lake 格式。使用 --download-images 可生成带本地图片路径的 Markdown。 {}
AI训练与推理的硬件需求有什么区别?
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 在人工智能项目的全生命周期中,训练(Training) 和 推理(Inference) 是两个至关重要的阶段。虽然它们都需要算力支持,但在计算资源、内存容量、存储系统和通信带宽等方面的需求差异很大。 1. 计算资源需求对比 训练是一个计算密集型的工作,需要反向传播(Backward Pass)和梯度计算,计算量约为推理的 2~3 倍,同时训练并行化需求高,常
为什么AI需要专属的基础设施?
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 近几年,人工智能尤其是大模型的爆发式发展,让算力、存储、网络等基础资源的需求呈现指数级增长。传统的IT基础设施虽然支撑了互联网时代的业务运行,但面对AI训练和推理的超高计算密度、海量数据吞吐和低延迟需求时,显得力不从心。为了让AI技术真正落地,我们需要针对AI特性量身定制的AI基础设施(AI Infrastructure)。 1. 什么是AI基础设施? AI
AI 基础设施
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · > 正文为语雀 Lake 格式。使用 --download-images 可生成带本地图片路径的 Markdown。 {}
大模型的安全、偏见与伦理挑战
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 随着大模型在越来越多的领域落地,它不仅是技术问题,也是一个社会问题。模型是否公平?是否会泄露隐私?生成的内容是否合规?这些问题越来越重要。下面从偏见、公平性、隐私安全,以及法律伦理三个角度展开整理。 偏见与公平性 大模型的偏见本质上来源于数据和模型训练方式。模型看似中立,但只要数据带有倾向性,模型就会在输出中放大这种倾向。 数据偏见 数据偏见来自于训练数据本
大模型幻觉
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 大语言模型(LLM)如 ChatGPT、Claude、Gemini 等,正以前所未有的方式改变我们的工作与生活。但在享受它们带来的便利时,我们也越来越频繁地遇到一个令人困惑的问题:它们有时会一本正经地胡说八道,仿佛陷入了幻觉。 比如: “帮我找一篇关于‘Prompt Tuning’的论文。” 模型回答:“请参考《Prompt Tuning for Few-S
大模型安全与挑战
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · > 正文为语雀 Lake 格式。使用 --download-images 可生成带本地图片路径的 Markdown。 {}
Function Calling
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 在现代 AI 系统中,语言模型不仅可以生成文本,还可以直接调用外部功能或服务。这种机制被称为 Function Calling。Function Calling 的原理、工作流程是什么?与 MCP(模型上下文协议)的区别又是什么呢? 1. 什么是 Function Calling Function Calling 是指语言模型在生成文本的过程中,能够识别并触
MCP vs A2A
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · 在智能代理开发领域,随着多智能体系统和工具集成的普及,我们经常会遇到两个概念:模型上下文协议(MCP)和Agent2Agent 协议(A2A)。它们都是为了让智能体更好地互相协作或与外部资源交互而设计的,那他们到底有什么区别,又各自有什么用呢? 1. 为什么需要两类协议? 简单来说,智能体与外部世界的交互可以分为两类: 第一个是工具和资源类,&amp
Agent2Agent
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 在过去几年,人工智能的发展让单个智能体已经能完成越来越复杂的任务,比如写文章、做数据分析、甚至协助编程。但当任务变得更复杂、需要多个智能体分工协作时,我们就会遇到一个问题:不同智能体之间怎么有效沟通? 如果每个智能体各说各话,就像一个人说中文、一个说英文,合作就会非常困难。这时候,一套统一的通信标准就显得至关重要——这就是今天要介绍的 Agent2Agent
上一页
第 4 / 21 页
下一页