赛博牛马
AI 资源导航与内容门户
搜
/
首页
资源
文章
专题
浅色
快速搜索
首页
/
文章
文章
编辑精选与公众号导入
仅展示已发布内容,支持分页浏览。
大模型框架性能优化策略
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · 在大模型应用和推理系统中,性能优化是关键环节。无论是 LangChain、vLLM 还是 RAG 系统,架构设计、推理策略和资源调度都会直接影响延迟、吞吐量和成本。 1. 延迟优化策略 延迟优化旨在降低用户等待时间,主要方法包括: 批量推理(Batching):将多个请求合并为一个批次执行,充分利用 GPU 并行计算能力。 异步执行:非阻塞任务调度,用户请求
Unsloth
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · 在大语言模型(LLM)应用快速发展的背景下,如何高效地在消费级硬件上进行模型的微调与部署,成为了开发者们普遍关注的问题。Unsloth 框架正是在这样的需求下应运而生,它提供了一种轻量级、易用且高效的方式来进行 LLaMA、Mistral 等模型的微调,大幅度降低了资源门槛。 前面我们介绍了LangChain, Vllm,TRL, PEFT, LLaMA F
LLaMA Factory
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · 近年来,大语言模型(LLM)在自然语言处理(NLP)领域取得了突破性进展。然而,直接训练或微调这些模型往往需要昂贵的计算资源和复杂的工程实现,这使得许多研究者和开发者在落地应用时面临困难。为此,开源社区涌现出了一系列面向大模型的高效训练与推理框架,前面我们介绍了LangChain,vLLM,PEFT,TRL,现在我们来看一下 LLaMA Factory 。
PEFT
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · 在大模型浪潮下,如何让模型在 低成本、低门槛 的条件下完成特定任务的适配,是开发者和研究者共同关注的问题。 Hugging Face 推出的 PEFT(Parameter-Efficient Fine-Tuning)框架,为这一挑战提供了系统化的解决方案。这篇文章就是带大家看一下PEFT框架到底是何方神圣。 1. 什么是 PEFT? PEFT 是 Huggi
TRL
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · 近年来,大语言模型(LLMs)的快速发展推动了下游应用的繁荣,但如何高效地对这些模型进行对齐和微调,依然是研究与应用的热点。Hugging Face 开源的 TRL(Transformer Reinforcement Learning) 框架,提供了基于强化学习的语言模型训练方法,并支持 SFT(监督微调)、PPO(近端策略优化)、DPO(直接偏好优化)等多
知识管理与 RAG 框架
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · 在大模型工程中,知识管理与检索增强生成(RAG, Retrieval-Augmented Generation) 是提升模型准确性和实用性的关键。通过将文档、向量索引、长期记忆和多数据源结合,大模型能够在复杂任务中实现知识增强生成。 前面我已经介绍了RAG的概念,工作流程,并且用LangChain框架实现了一个小小的demo,除了LangChain框架,还有
vLLM
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · 在大模型应用中,推理性能往往成为限制系统规模和用户体验的关键因素。为此,vLLM 应运而生,提供了高吞吐量、低延迟的推理引擎,并支持多模型协作和异构硬件调度。vLLM 不仅可以独立作为推理服务,还能与 LangChain 等工程框架无缝集成,实现完整的业务流程编排。 1. vLLM 核心架构解析 vLLM 是一个高性能推理引擎,核心架构包括模型加载与管理、请
LangChain框架实战(RAG)
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · 一、引言 在大模型(LLM)应用中,如何让模型准确回答领域知识问题是一个关键挑战。直接依赖预训练模型往往会遇到 幻觉(hallucination),因为模型可能“编造”不存在的事实。 为了解决这一问题,业界提出了 RAG(Retrieval-Augmented Generation,检索增强生成) 方法:通过检索外部知识库,将相关信息提供给模型,从而提升回答
LangChain
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · LangChain 作为目前最流行的大模型工程化框架之一,提供了从业务逻辑编排、工具调用、知识管理到多模型协作的完整解决方案。它不仅让大模型能够更好地落地企业应用,还为复杂多轮任务提供了可扩展、高性能的架构支持。 1. LangChain 核心组件解析 LangChain 架构由四个核心模块组成: Chains:将模型调用和业务逻辑组织成链式结构,实现任务分
大模型工程框架生态全览
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · 随着大语言模型(LLM)的快速发展,单纯依赖原始模型已经无法满足复杂的业务需求。如何高效管理模型、构建多轮对话、集成外部工具和知识库、同时保证高性能推理,成为大模型落地的核心挑战。为此,越来越多工程化框架应运而生,如 LangChain、vLLM、LlamaIndex、Haystack 等,它们为大模型应用提供了完整的生态和工具链。 1. 大模型工程框架的核
大模型框架
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · > 正文为语雀 Lake 格式。使用 --download-images 可生成带本地图片路径的 Markdown。 {}
GRPO
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · 在大语言模型(LLM)的训练与对齐过程中,如何在保证模型性能的同时提升训练效率,一直是学界和工业界关注的焦点。常见的方法有 PPO(Proximal Policy Optimization) 和 DPO(Direct Preference Optimization),但它们各自也有一些局限性。最近提出的 GRPO(Group Relative Policy
DPO
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · 近年来,大语言模型(LLM)微调领域持续探索更高效的方法。传统 RLHF 需先训练奖励模型,再用强化学习优化模型策略,流程复杂且计算资源消耗大。尽管PPO非常成功,但是RLHF中的PPO非常复杂,要同时维护和训练多个模型,包括策略模型、奖励模型、价值模型和SFT参考模型。DPO(Direct Preference Optimization)作为一种新兴技术,
PPO
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · 随着大模型能力不断提升,单纯依赖监督微调难以满足复杂的人类偏好需求。强化学习,尤其是 PPO(Proximal Policy Optimization),成为调优模型生成行为、提升输出质量和对齐性的关键技术。 一、PPO 背景与意义 强化学习通过奖励信号优化策略,适合训练生成模型以符合复杂目标。然而传统强化学习算法如 TRPO 复杂难调,训练不稳定。 PPO
SFT监督微调
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · 随着大规模预训练模型(如 GPT、LLaMA)的兴起,单靠无监督预训练难以满足具体任务需求。 监督微调(Supervised Fine-Tuning,简称 SFT)通过在带标签的数据上有针对性训练,使模型更好地适应特定应用场景。 一、SFT 在大模型训练中的角色 预训练阶段侧重于学习通用语言知识和模式,训练数据无须人工标注,规模巨大但缺乏针对性。SFT 则是
RLHF
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · 随着大语言模型(LLM)规模和能力飞跃,单纯依赖预训练和监督微调难以让模型完全符合人类期望。 RLHF 通过结合人类反馈和强化学习,显著提升模型的对齐性和输出质量,成为当前 AI 安全和性能优化的重要手段。 一、RLHF 背景与意义 预训练模型虽能力强大,但容易生成不合适、不准确甚至有害内容。同时传统监督微调虽能提升部分表现,但无法充分捕捉复杂的人类价值和偏
提示微调
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · 一、背景与挑战 传统微调需要更新模型的全部或部分权重,带来: 显著的计算资源消耗; 大量存储开销; 多任务场景下管理和部署复杂。 提示微调则通过设计和学习软提示向模型注入任务信息,避免修改模型参数,极大降低训练成本和维护复杂度。 二、提示微调的核心技术原理 提示微调的关键是将任务信息编码为可学习的连续向量(软提示),附加到输入序列前端: 软提示向量:一组可训
AdaLora
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · 随着大规模语言模型的不断壮大,如何在有限资源下高效微调模型,成为研究热点。 传统 LoRA 固定低秩大小,难以兼顾所有层的复杂性和任务需求。 AdaLoRA(Adaptive LoRA)创新地引入动态调整秩的机制,根据层的重要性和训练过程自动分配参数资源,提升微调效果和效率。 一、背景与挑战 LoRA 通过低秩矩阵分解实现参数高效微调,显著降低训练成本。 但
QLora
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · 一、背景与挑战 LoRA 通过低秩分解减少微调参数,大幅降低训练资源需求,但面对超大模型(百亿参数及以上)时,显存仍然紧张。 这是因为: 大模型原始权重和激活仍占用大量显存; 传统 16/32 位浮点训练难以在单卡或小规模集群上运行。 为此,社区尝试引入量化技术,将模型权重压缩至更低比特表示,减少显存占用。 QLoRA 正是将 LoRA 和 4-bit 量化
LORA微调
2026年5月28日
· 4 阅读 · 赛博牛马教程库 · LORA微调 随着大规模预训练模型不断增大,模型微调的资源需求和部署复杂度也急剧提升。 LoRA(Low-Rank Adaptation)作为近年来高效微调的代表方案,因其在显存占用、训练效率和部署便捷性之间取得了平衡,迅速成为大模型微调的首选。 背景与挑战 在 LoRA 出现之前,微调大模型通常依赖全参数微调或 Adapter 方案。 全参数微调虽然效果最
上一页
第 6 / 21 页
下一页