赛博牛马
AI 资源导航与内容门户
搜
/
首页
资源
文章
专题
浅色
快速搜索
首页
/
文章
文章
编辑精选与公众号导入
仅展示已发布内容,支持分页浏览。
微调技术的发展与演进
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 现在的大语言模型发展得非常快,从几亿参数到千亿参数,不仅模型越来越大,能力也越来越强。但是在实际工作中,我们很少会从零开始训练一个这样的巨无霸模型,因为那样的成本和资源需求实在太高了。 更多的时候,我们会先用一个现成的强大模型,然后根据自己的需求对它做一些微调,让它更懂我们的领域、更符合我们的业务和价值观。 微调并不是一开始就有这么多方法,它的技术路线也是一
什么是微调
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 在当今自然语言处理领域,预训练语言模型如GPT、BERT等凭借强大的通用能力,已经成为推动技术进步的重要引擎。然而,仅仅依赖这些通用模型,往往难以满足具体任务的特殊需求。为了让预训练模型更精准地适配各种下游任务,“微调”这一技术应运而生。 1. 什么是微调? 在自然语言处理(NLP)和机器学习领域,微调(Fine-tuning)指的是在一个已经预训练好的模型
大模型微调
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · > 正文为语雀 Lake 格式。使用 --download-images 可生成带本地图片路径的 Markdown。 {}
大模型分布式训练框架
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 训练大规模深度学习模型不仅依赖优化器和硬件,还需要高效的训练框架。不同框架在功能、性能和易用性上各有特点,针对 GPU/TPU、多节点分布式训练和混合精度计算有不同的支持策略。 1. PyTorch Pytorch是最经典的训练框架了,它基于动态图机制,易于调试和扩展,社区活跃,生态完善。适用于研究型大模型训练、原型开发、中小规模分布式训练。 分布式训练中使
分布式通信优化
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 在大模型训练中,通信效率直接影响训练吞吐量和扩展性。Horovod 是 Uber 开源的高性能分布式训练框架,专注于多 GPU / 多节点的梯度同步,而 NCCL(NVIDIA Collective Communications Library)提供了 GPU 之间高效的通信原语。 一、Horovod 通信原理 在分布式训练中,每个 GPU 会计算自己负责的
ZeRO系列解析
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 在大模型训练中,显存瓶颈是制约模型规模的重要因素。DeepSpeed 推出的 Zero Redundancy Optimizer(ZeRO) 系列,通过将模型状态(参数、梯度、优化器状态)分布到不同 GPU 上,实现显著的显存优化。 1. ZeRO 核心原理 ZeRO的全称为 Zero Redundancy Optimizer,意思是去除冗余的优化器,我们都
模型并行训练策略
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 随着模型参数量快速增长,超过单张 GPU 显存承载能力的情况越来越常见。对于超大规模模型(如百亿参数以上),仅靠数据并行已无法训练。这时,模型并行(Model Parallelism) 应运而生,它通过将模型本身拆分到多张 GPU 上进行计算,实现显存扩展和训练加速。 1. 模型并行概述 模型并行的核心思想是将模型本身拆分到多张 GPU 上,每张 GPU 只
数据并行训练实践
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 在训练中等规模到大型深度学习模型时,单块GPU可能无法充分利用计算资源或处理足够的数据批次。数据并行(Data Parallel, DP)是一种简单且高效的并行训练策略,通过在多张GPU上复制模型副本并分批处理数据,实现训练加速和性能优化。本文将结合 PyTorch DDP 和 TensorFlow MirroredStrategy,分享数据并行训练的实践经
分布式训练原理与基础架构
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 随着大模型规模不断增长,单卡训练已经无法满足计算和存储需求。分布式训练成为模型训练的必备手段,从底层硬件基础架构到梯度同步与优化器机制,每一环节都直接影响训练效率和收敛效果。 1. 分布式训练基础架构 大模型训练涉及大量计算和数据传输,需要合理的硬件和网络布局: GPU集群与节点:分布式训练通常由多个 GPU 节点组成,每个节点包含若干 GPU。节点数、GP
数据并行VS模型并行VS混合并行
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 随着深度学习模型规模不断增大,从几亿参数到上百亿甚至千亿参数,单块GPU已经难以承载模型训练的显存和计算需求。为了突破显存限制、提升训练速度,同时应对分布式环境下的通信挑战,研究者提出了多种并行训练策略,包括数据并行,模型并行和混合并行,下面我们一起来看一看。 一、为什么需要并行训练 随着模型参数量的快速增长,从几亿到上百亿甚至千亿参数,大模型的训练已经远远
混合精度计算
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 在大模型训练时代,模型参数规模动辄数百亿甚至上万亿,传统的 FP32 单精度训练 已经无法满足显存和速度的需求。混合精度(Mixed Precision Training)技术通过在保持模型精度的同时使用更低位数的浮点格式(如 FP16、BFLOAT16),有效减少显存占用、提升吞吐量,已经成为深度学习训练的标配。 1. 什么是混合精度计算? 混合精度计算是
GPU vs TPU
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 在人工智能,尤其是深度学习和大模型的浪潮中,算力已成为推动技术进步的核心引擎。GPU(图形处理器)和TPU(张量处理器)是两种主流的AI计算硬件,它们既有相似之处——都擅长并行浮点运算,又有显著的架构与定位差异。 本文将从架构原理、适用场景和性能差异三个维度,深入剖析GPU与TPU。 1. GPU与TPU简介 GPU(Graphics Processing
数据存储
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 在大模型时代,AI 的训练与推理已经不再是单纯的算力问题。随着模型参数规模进入百亿级、数据量级扩展到 TB~PB,数据管线与存储架构往往成为影响训练速度的决定性因素。算力再强,如果数据加载跟不上,也会出现 GPU 空闲等待 I/O 的情况,训练效率大打折扣。 1. 分层存储与数据组织 在实际落地中,数据通常采用“热、温、冷”三层架构。 Hot 层存放的是训练
数据准备
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 谈到大模型,很多人第一反应都是模型参数大、算力强,但其实数据才是大模型真正的底座。没有足够大、足够干净的数据,再先进的模型也发挥不出威力。今天就从数据层面,把大模型训练的几个关键环节梳理清楚。 数据采集与清洗 大模型训练所需的数据量非常庞大,需要覆盖尽可能多的知识和语境。 通常包括: WebText 从互联网上抓取的网页文本,是大模型最重要的训练源之一。 需
大模型训练
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · > 正文为语雀 Lake 格式。使用 --download-images 可生成带本地图片路径的 Markdown。 {}
Kimi系列
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · Kimi Linear Kimi最近提出了Kimi Linear,这是一种混合线性注意力(Hybrid Linear Attention)架构。它首次在公平比较中,于短上下文、长上下文和强化学习(RL)等多种场景下,全面超越了全注意力(Full Attention)架构。 也就是说,Kimi Linear 证明了自己是全注意力架构的“即插即用”替代品,同时提
LongCat系列
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · LongCat-Flash 最近,美团开源的 LongCat-Flash 彻底炸了 AI 圈。 一方面,它用 国产算力 完成了一个 5600 亿参数的大模型训练;另一方面,它用一系列极具工程狠劲的设计,解决了很多 DeepSeek 一直头疼的系统级瓶颈。LongCat-Flash 可以说是一次真正懂大模型训练痛点的人干出来的技术工程奇迹。 一、LongCat
DeepSeek系列
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · DeepSeek LLM 大语言模型(LLM)已经成为通往通用人工智能(AGI)的关键路径。自 ChatGPT 引爆公众关注后,开源社区也不断追赶,推出 LLaMA、Mistral、Yi 等模型,逐步缩小与闭源模型的差距。 DeepSeek LLM 是一项来自 DeepSeek-AI 的开源努力,不仅在架构、训练调度、数据处理等方面延续了高水准的工程实践,更
LLAMA系列
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 在深入了解了 GPT 系列模型的发展脉络之后,我们不禁要问:大模型的未来一定是越大越强吗?OpenAI 的 GPT-3 拥有 1750 亿参数,Google 的 PaLM 甚至达到了 5400 亿。但在另一条赛道上,Meta 提出了一个截然不同的答案 —— LLaMA(Large Language Model Meta AI)。它不
GPT系列
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · GPT可以说是火的一塌糊涂,切切实实的改变了我们的工作和生活。 从写代码、写文案,到作图、聊天、做分析,GPT 系列模型已然成为通用人工智能的代表性成果。 GPT1:通用语言理解模型的开端 在深度学习尚未普及的年代,自然语言处理(NLP)领域面临一个普遍难题:大多数模型都严重依赖大量人工标注的数据,这不仅耗费人力物力,还限制了模型在低资源场景下的表现。而与此
上一页
第 7 / 21 页
下一页