赛博牛马
AI 资源导航与内容门户
搜
/
首页
资源
文章
专题
浅色
快速搜索
首页
/
文章
文章
编辑精选与公众号导入
仅展示已发布内容,支持分页浏览。
什么是 AI Agent
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 在大模型技术快速发展的背景下,越来越多的应用不再仅仅把大语言模型当作一个“文本生成工具”,而是把它当作系统中的智能决策核心。在这种架构下,大模型不只是回答问题,而是能够理解目标、规划步骤、调用工具并完成任务,这种具备自主决策能力的系统通常被称为 AI Agent(人工智能智能体)。 简单来说,AI Agent 是一种以大语言模型为核心,通过推理、规划和工具调
AI Agent 原理
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · > 正文为语雀 Lake 格式。使用 --download-images 可生成带本地图片路径的 Markdown。 {}
RAGAS 评估
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 在大模型应用快速落地的今天,RAG(Retrieval-Augmented Generation,检索增强生成)已经成为企业级知识问答系统的标准架构之一。然而,一个现实问题是:RAG系统看起来能回答,并不等于回答是可靠的。因此,如何系统性评估RAG效果,就成为工程落地中的关键问题。RAGAS(Retrieval Augmented Generation As
高级 RAG
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 随着大模型应用不断深入,传统的 RAG 架构已经难以满足复杂业务场景的需求。基础 RAG 主要解决的是“从知识库中检索相关文档并生成回答”的问题,但在真实系统中,知识来源往往更加复杂,问题推理过程也更加多样。因此,越来越多的系统开始在 RAG 基础之上构建更高级的检索和推理机制,这类技术通常被称为 高级 RAG(Advanced RAG)。 高级 RAG 的
RAG 进阶
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 在完成基础的 RAG 架构搭建之后,如果希望系统能够在真实业务场景中稳定运行,还需要进一步进行检索和上下文优化。简单的 RAG 系统通常只包含“向量检索 + LLM 生成”两个步骤,但在复杂知识库中,这种结构往往会遇到一些问题,例如检索结果不稳定、上下文噪声过多或者模型输入长度受限。 因此,在实际工程中,很多团队会在 RAG Pipeline 中加入更多优化
RAG 召回优化
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 在 RAG 系统中,召回(Retrieval Recall)质量直接决定了最终回答的上限。即使大语言模型具有很强的推理能力,如果检索阶段没有找到真正相关的文档,大模型也无法生成正确答案。因此,在实际工程实践中,很多团队都会投入大量精力优化 RAG 的召回能力。 召回优化的核心目标是:尽可能找到更多与用户问题相关的文档,同时避免引入过多无关信息。如果召回结果过
文档处理
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 在 RAG 系统中,文档处理(Document Processing)是整个知识库构建流程中的关键环节之一。虽然在整体架构中,向量数据库和大语言模型往往更受关注,但在实际工程实践中,文档处理往往决定了 RAG 系统检索效果的上限。如果文档解析不准确、文本切分不合理或元数据设计混乱,即使使用性能再强的 Embedding 模型和向量数据库,也很难获得理想的检索
向量数据库
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 在 RAG 系统中,向量数据库(Vector Database)是整个检索模块的核心组件之一。它负责存储文本、图像或其他数据经过 Embedding 模型转换后的向量表示,并在用户查询时快速找到与查询向量最相似的数据。可以说,向量数据库决定了 RAG 系统的检索效率与召回质量,是构建高性能知识库系统的关键基础设施。 传统数据库通常用于存储结构化数据,例如表格
RAG 架构
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 在理解了 RAG 的基本概念之后,下一步需要关注的是 RAG 系统在工程上的整体架构。RAG 并不是一个单一的模型,而是一套由多个模块组成的系统流程。在实际应用中,一个完整的 RAG 系统通常包含 查询处理、向量检索、上下文构建以及大模型生成等多个阶段,这些阶段共同构成了一个典型的 RAG Pipeline。 从整体流程来看,RAG 的基本架构可以表示为:
RAG 基础
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 什么是 RAG RAG(Retrieval-Augmented Generation,检索增强生成)是一种将信息检索系统(Retrieval System)与大语言模型(LLM)结合的技术架构,其核心思想是:在模型生成答案之前,先从外部知识库中检索与用户问题相关的内容,然后将这些内容作为上下文输入给模型,从而生成更加准确、可靠的回答。 传统的大语言模型在推理
RAG 原理
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · > 正文为语雀 Lake 格式。使用 --download-images 可生成带本地图片路径的 Markdown。 {}
结构化输出
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 在许多 AI 应用场景中,大语言模型的输出并不是直接展示给用户,而是需要被程序进一步处理。例如在 AI Agent、RAG 系统、自动化工作流、数据分析系统以及智能客服系统 中,模型的输出往往需要被代码解析,然后用于后续逻辑判断或工具调用。如果模型只返回普通自然语言文本,系统就很难稳定地读取和处理这些信息。 因此,在 Prompt Engineering 中
Prompt 安全
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 随着大语言模型逐渐被应用到客服系统、搜索系统、AI Agent 以及自动化工作流等真实业务场景中,Prompt 不再只是简单的输入文本,而成为 系统逻辑的一部分。在这种情况下,如果 Prompt 受到恶意操控,模型就可能执行错误指令,甚至泄露系统信息。因此,Prompt 安全(Prompt Security)逐渐成为 AI 系统设计中的重要问题。 Promp
Prompt 模板设计
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 在实际 AI 系统开发中,Prompt 很少以“临时文本”的形式存在,而通常会被设计为 可复用、可维护、可扩展的 Prompt 模板(Prompt Template)。这种做法的原因在于,大语言模型往往需要在系统中被反复调用,如果每一次调用都手动编写 Prompt,不仅效率低下,还会导致系统难以维护。 因此,在工程实践中,开发者通常会将 Prompt 抽象为
Agent Prompt 技术
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 随着大语言模型逐渐从“对话工具”演变为能够执行复杂任务的 AI Agent,Prompt 的作用也发生了明显变化。在传统问答场景中,Prompt 主要用于描述问题并获取答案,而在 Agent 系统中,Prompt 不仅需要表达任务,还需要引导模型进行 规划、推理、工具调用以及结果反思。因此,针对 Agent 系统的 Prompt 设计逐渐形成了一套新的技术体
Prompt 技术范式
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 在大语言模型的应用实践中,人们逐渐发现,不同的 Prompt 设计方式会显著影响模型的推理能力与输出质量。因此,研究者和工程实践者逐步总结出一系列 Prompt 技术范式(Prompting Paradigms)。这些范式本质上是引导模型理解任务、进行推理以及生成答案的方法体系。 从最简单的直接提问,到通过示例进行引导,再到显式地让模型展示推理过程,不同的
什么是 Prompt Engineering
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 随着大语言模型能力的不断提升,人们逐渐发现:模型本身的能力只是上限,而如何与模型沟通,则决定了实际效果。在这种背景下,Prompt Engineering(提示工程)逐渐成为构建 AI 应用的重要技术之一。它本质上是一种通过设计输入提示词(Prompt),引导大语言模型生成更准确、更稳定输出的方法体系。 简单来说,Prompt Engineering 就是为
提示词工程
2026年5月28日
· 5 阅读 · 赛博牛马教程库 · > 正文为语雀 Lake 格式。使用 --download-images 可生成带本地图片路径的 Markdown。 {}
AdaLora
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 随着大规模语言模型的不断壮大,如何在有限资源下高效微调模型,成为研究热点。 传统 LoRA 固定低秩大小,难以兼顾所有层的复杂性和任务需求。 AdaLoRA(Adaptive LoRA)创新地引入动态调整秩的机制,根据层的重要性和训练过程自动分配参数资源,提升微调效果和效率。 一、背景与挑战 LoRA 通过低秩矩阵分解实现参数高效微调,显著降低训练成本。 但
QLora
2026年5月28日
· 3 阅读 · 赛博牛马教程库 · 一、背景与挑战 LoRA 通过低秩分解减少微调参数,大幅降低训练资源需求,但面对超大模型(百亿参数及以上)时,显存仍然紧张。 这是因为: 大模型原始权重和激活仍占用大量显存; 传统 16/32 位浮点训练难以在单卡或小规模集群上运行。 为此,社区尝试引入量化技术,将模型权重压缩至更低比特表示,减少显存占用。 QLoRA 正是将 LoRA 和 4-bit 量化
上一页
第 19 / 21 页
下一页