本文介绍了AI应用的四层架构:模型层负责理解与生成,知识层负责找材料,执行层让模型从“会说”走向“会做”,交付层负责检验结果。通过定位术语在系统中的位置,可以帮助初学者更好地理解和应用AI技术,避免被复杂的缩写和术语所迷惑。
参加一场AI会议,有时像误入了缩写接龙。
“我们准备用多模态大模型做Agent,接上RAG和MCP,再用Graph编排,最后补Evals和Guardrail。”
每个词单独查都能看懂,连在一起却容易让人摸不着头脑。更麻烦的是,这些词并不在同一层:Token是模型处理信息的单位,RAG是一种取资料的方法,MCP是连接外部系统的协议,Evals负责检验结果。把它们摆在同一张“能力排行榜”里,就像争论发动机、导航、充电接口和年检制度谁更重要。
我更推荐一种省脑子的记法:不用背定义,而是先问它在整套AI系统里站哪一层。
01|先记住四层,术语就不会乱
一套能真正完成工作的AI应用,大致可以拆成四层。
模型层负责理解与生成,常见词有LLM、多模态、Token、上下文和推理;知识层负责找材料,包括Embedding、向量库、RAG和微调;执行层让模型从“会说”走向“会做”,会遇到工具调用、Agent、Loop、Memory、Skill、MCP和Graph;交付层负责回答“这次到底做对没有”,对应Evals、Trace、Guardrail和人工审批。
这四层不是行业标准架构,只是一张便于理解的地图。现实产品会把若干部件合并,也会使用自己的名字。地图的价值在于定位:以后再看到一个新词,先判断它改变了模型、上下文、外部连接,还是验收方式。
模型处理信息,知识层补资料,Agent调用工具行动,交付层检查结果。
02|模型层:它到底在处理什么
LLM,大语言模型。从技术上说,语言模型学习的是Token序列出现的概率。聊天时看起来像在“回答问题”,底层动作仍是一段接一段地预测。它能压缩大量语言规律,却不是一座可以按书名精确取回原文的数据库。
参数。参数是模型训练后得到的数值权重,决定它如何处理输入。参数多,通常意味着容量更大,不等于每个问题都调用全部参数,也不自动保证事实正确。
Token。Token是模型读写信息的基本单位,可能是一个字、词的一部分或标点,不等于固定数量的汉字。输入、输出、工具返回和思考过程都可能消耗Token,接口成本与速度也常按它计算。讨论“这篇文档有多长”时,字符数只能粗估,真正限制模型的是Token数。
上下文窗口。它表示一次运行中模型最多能处理多少Token,通常包含指令、消息、检索资料、工具结果和输出空间。窗口大,说明桌面能摊开的材料多;它不等于永久记忆,也不保证模型同等重视每一页。
Prompt与系统提示词。Prompt是发给模型的指令或输入。系统提示词通常放置角色、目标和行为边界,优先级高于普通用户消息。把一句Prompt写得更漂亮叫提示词工程;决定本轮该放入哪些历史、资料、工具说明和记忆,更接近上下文工程。
推理(Inference)。工程文档里的Inference,常指模型训练完成后的实际运行:接收输入并生成结果。中文语境还会把Reasoning翻译成“推理”,指多步分析能力。两者经常同名,读参数表时要看清说的是运行阶段,还是解题能力。
多模态。模型能在文字之外处理图片、音频或视频,就属于多模态。它不是“多个模型一起工作”的简称。不同模态最后也要被编码成模型能处理的表示,并占用相应的上下文预算。
Anthropic将上下文工程画成动态取舍过程。Agent需要在有限上下文中选择文档、工具、记忆与历史,而不是一次塞入全部材料。
温度(Temperature)影响生成时的采样分布,数值高通常更发散,数值低通常更集中。低温度不等于事实准确,不同模型的推荐设置也不一样。
03|知识层:RAG、Embedding和微调不是一回事
模型知道很多,却总会遇到训练后才出现的信息、企业私有资料和需要逐条引用的事实。知识层处理的就是这道缺口。
Embedding,向量表示。Embedding会把一段文字、图片或其他对象转换成一组数字,使语义接近的内容在向量空间里更靠近。它像给资料按“意思”分配坐标,不只按关键词找字面相同的句子。
向量库。向量库负责保存这些坐标并进行相似度检索。它找到的是“更像的内容”,不是“被证明为真的内容”。切片方式、Embedding模型、召回数量和重排策略都会影响搜索质量。
RAG,检索增强生成。常见流程是:先把用户问题转成Embedding,到知识库里找相关片段,再把片段放进上下文,请模型据此回答。RAG改变的是本次模型看到了什么。资料更新后可以重新索引,也方便带出来源,所以常用于企业知识库、客服和研究助手。
Grounding,依据约束。它强调把生成结果锚定在可核验的数据源上,RAG是常见做法。
Hallucination,幻觉。模型生成了听起来顺畅、事实却不成立的内容。RAG能提供证据,无法保证零幻觉:检索可能找错,材料可能过期,模型也可能读歪。因此,引用对应检查和答案评测仍然要保留。
Fine-tuning,微调。微调会用训练样本更新模型权重,让输出风格、格式或某类任务行为更稳定。它更像训练厨师形成固定手法;RAG像开工前把当天的新菜单和食材清单递给厨师。
RAG适合补充可更新知识和依据;微调适合固化风格与任务行为,两者也可以组合使用。
遇到“模型不知道公司最新制度”,先考虑RAG;遇到“模型每次输出格式都飘,靠Prompt仍不稳定”,再评估微调。拿微调硬记频繁变化的制度,维护成本会很高;拿RAG修正所有行为问题,也容易把知识库越堆越乱。
04|执行层:从会回答到会办事
Tool Calling,工具调用。模型根据工具说明,输出要调用的函数名和参数;真正访问天气、数据库或邮件系统的,是外部程序。模型负责提议动作,运行时负责校验参数、执行权限和返回结果。
Agent,智能体。一个常见工程定义是:模型能够围绕目标选择步骤、使用工具,并根据中间结果调整后续行动。加了一个搜索按钮的聊天机器人不一定就是Agent;反过来,Agent也不代表可以无限自主运行。
Agent Loop。典型循环是“计划—调用—观察—调整”。它让Agent看到工具返回后继续推进,适合路径无法完全预先写死的任务。退出条件、重试上限和预算不清时,Loop也可能原地打转。
Memory,记忆。短期记忆通常就是当前上下文或压缩后的历史;长期记忆则把用户偏好、任务状态或过去结果保存到外部存储,需要时再取回。Memory不是模型脑内突然多了一个抽屉,它涉及写入条件、检索、过期和隐私权限。
Skill,技能。Skill更像一份可版本化的操作规程,告诉Agent某类任务怎么做、用什么工具、交付前检查什么。Prompt偏向本次要求,Skill强调流程复用。Skill被加载,也不等于每条规则必然执行,因此还需要独立验收。
MCP,模型上下文协议。MCP是一套让AI应用连接外部工具和数据的开放协议。官方架构包含Host、Client和Server,并定义Tools、Resources、Prompts等原语。它像统一接口,不等于工具本身;接上MCP服务器,也不代表Agent自动拥有全部权限。
Graph与Workflow。Graph把任务表示为状态、节点和边,明确先后、分支、并行、重试和人工审批。它可以把一个Agent Loop装进某个节点,也可以协调多个Agent。Graph工程与知识图谱、GraphRAG不是同一个概念。
Multi-Agent,多智能体。多个Agent按角色协作。角色多不等于观点独立;使用相同材料和模型,可能只是把同一种错误复印多份。
05|交付层:能跑起来,不等于能放心使用
Evals,评测。Evals是一套有任务、测试样例、评分规则和指标的重复实验,用来判断模型或Agent是否达到要求。公开Benchmark是大家共用的标准化试卷;项目Evals则应该贴近自己的用户、数据和失败代价。
Agent评测比单轮问答麻烦。结果对了,路径可能越权;结果错了,也可能是检索、工具、环境或权限故障。除了最终答案,还要看任务完成率、工具选择、引用质量、成本、延迟和人工接管。
Trace,可追踪记录。Trace保存一次任务经过的模型调用、工具参数、状态变化和耗时。它像飞行记录仪,主要用于排错和复盘;只留最终回答,往往无法判断错误从哪一步开始。
Guardrail,护栏。护栏是输入、输出或行动边界,例如敏感信息检测、工具参数校验和禁止访问某些路径。它不能只写在提示词里。付款、删除、群发和权限变更,还要配沙箱、最小权限与人工审批。
Anthropic的Agent Evals组件图。评测对象不只是最后一句回答,还包括工具调用、状态、执行轨迹和最终环境。
06|把术语放进一次真实任务
假设用户要求:“分析本月客户投诉,找出前三类问题,生成报告并发给负责人。”
系统提示词先规定角色和权限;上下文工程选择本轮需要的对话历史、部门规则和可用工具。RAG把投诉分类标准与产品文档找出来,Embedding和向量库负责语义检索。
Agent进入Loop:先计划,再通过MCP工具读取数据库;发现某类投诉需要核对版本记录,继续调用另一个工具。Skill规定报告结构、引用方式和发信前检查。若数据抓取、分析和制图可以并行,Graph负责调度与汇合。
报告生成后,Evals检查分类覆盖率、数字一致性和引用;Guardrail确认没有泄露个人信息,Trace保存全程。最后停在人工审批前,负责人确认收件人与附件,系统才真正发送。
术语只有放回一条真实执行链,彼此关系才清楚。
这条链里没有哪个词能单独替代其他词。模型再强,也不会自动获得数据库权限;MCP接通了工具,不能替代业务Skill;Graph排好了流程,不能证明答案正确;Evals发现了问题,也不会替系统完成修复。
07|六组最容易混淆的概念
模型与Agent:模型负责理解和生成;Agent把模型、工具、状态与循环组装成执行系统。
Prompt与Skill:Prompt说明这次要什么;Skill沉淀一类任务的稳定做法。
上下文与Memory:上下文是本轮模型能看到的材料;Memory通常存放在外部,需要选择后再放回上下文。
RAG与微调:RAG更新本轮输入的知识;微调更新模型参数和行为。
工具调用与MCP:工具调用是模型提出一次动作;MCP规定AI应用如何发现并连接一组外部能力。
Benchmark与Evals:Benchmark方便横向比较;项目Evals判断系统能否完成自己的真实任务。
以后遇到新术语,可以再追问四句:它在哪一层?改变了模型参数,还是改变了输入和流程?它是协议、框架、产品名,还是厂商提出的概念?最后,有没有能复现的评测说明它确实有效?
这四个问题通常比背全称有用。
结语
AI术语多,是因为今天的AI应用已经不再只有一个模型和一个聊天框。模型、知识、工具、流程、安全和评测都在快速长出自己的工程体系。
理解这些词,不需要先成为算法专家。先找到它在系统里的位置,再看输入、输出和责任边界,含义就会具体很多。
下次再听到“RAG接MCP,用Skill驱动Agent,再跑一套Evals”,可以把它翻译成一句普通话:先找资料,按规程调用外部工具完成任务,最后把结果检查一遍。
能翻译回普通话,才算真的听懂了。
先定位,再理解
知道一个术语处在模型、知识、执行还是交付层,就不会再被缩写带着跑。
最后
2026 年一晃已经过半,AI 大模型的热潮不仅没有降温,反而持续升温!
金融行业用大模型做风控、医疗依靠 AI 解析影像,电商、制造、教育各行各业,都在把 AI 融入日常业务。曾经热闹的 “百模大战”,早就告别单纯比拼模型参数,正式进入落地应用时代。
现在企业疯狂紧缺一类人才:懂业务、懂 AI、能做出可上线项目的大模型开发工程师,岗位缺口大,薪资待遇十分可观。
风口再好,不如手握高薪 offer 实在。行情火热,普通人、程序员该怎样从零入门大模型,抓住这波机会?
今天整理好【2026 最新版】AI 大模型全套免费学习资源,覆盖零基础入门、项目实战、理论知识、大厂面试,从基础一路进阶。所有资料分类归档,没有多余杂料,无套路免费分享给想要入局 AI 赛道的程序员与零基础小白!
👇👇扫码免费领取全部内容👇👇
1、大模型系统化完整学习路线
2、大模型经典书籍&文档
3、AI 大模型最新行业研究报告
4、企业级实战项目 + 完整配套源码
5、大厂大模型面试真题汇总
6、这些资料真的有用吗?
这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】