本文以通俗类比和图解方式,梳理了AI Agent生态中的核心概念,包括LLM、Token、上下文窗口、Function Calling、RAG等。文章从模型基础层、能力增强层和工程协作层三个维度解析了Agent的构成和工作原理,帮助读者理解如何利用大模型构建能自主完成任务的系统。建议收藏,随时查阅。
最近两年,AI 圈最热的词大概就是 Agent(智能体)。它背后的名词更是一串接一串:LLM、Token、上下文窗口、Function Calling、RAG、知识库、向量数据库、Memory、ReAct、MCP、Multi-Agent、Orchestrator……很多人看文章像看天书。
这篇文章把 Agent 生态里的高频名词按"三层结构"梳理一遍,每个词给你一句话定义 + 一个通俗类比,最后用几张图讲清楚它们到底是怎么配合工作的。建议收藏,边用边查。
01 先回答一个问题:到底什么是 AI Agent?
AI Agent(人工智能智能体)可以理解为:一个以"大语言模型"为大脑、能够自主完成任务的系统。
它和普通聊天机器人最大的区别是:聊天机器人只负责"说",Agent 负责"做"。
比如你问聊天机器人"帮我订一张周五去上海的机票",它只能告诉你"你可以去某某 App 订";而一个 Agent 会自己去调用订票工具、查询航班、比价、下单,把一件完整的事办完。
用一句话概括 Agent 的公式,业界普遍认可的是:
Agent = LLM(大脑)+ Planning(规划)+ Memory(记忆)+ Tools(工具)
下面所有名词,都是在给这个公式的各个部分"添砖加瓦"。
02 先看全貌:Agent 名词全景图
整个 Agent 生态可以分成三层:模型基础层(Agent 的"身体")、能力增强层(Agent 的"手脚和记忆")、工程协作层(让 Agent 真正跑起来的"系统")。
03 第一层:模型基础层——Agent 的"身体"
这一层的名词解决的是"模型本身是什么、怎么描述输入输出"的问题。
LLM(大语言模型) 全称 Large Language Model,基于 Transformer 架构、用海量文本训练出来的语言模型。它负责理解你的问题并生成回答,是 Agent 的"大脑"。我们常说的 GPT、Claude、豆包、DeepSeek,指的都是这类模型。
Token(词元) 模型处理文本的最小单位。英文一个单词常被切成 1~2 个 Token,中文一个字大约对应 1~2 个 Token。Token 既是模型计费的"字数单位",也是上下文窗口的"容量单位"。
上下文窗口(Context Window) 模型单次能"同时看到"的 Token 上限。窗口越大,能一次性塞进去的对话、文档就越多。现在的旗舰模型普遍支持 128K 甚至 1M Token 的上下文。
Prompt(提示词) 你发给模型的指令文本。写提示词有一定方法论,叫 Prompt Engineering(提示工程)——好的提示词能让模型表现提升一个档次。注意:提示词只是"输入",不会改变模型的权重。
Embedding(向量化/嵌入) 把一段文字(或图片、声音)映射成一串高维数字(向量),让"意思相近的内容"在向量空间里距离也近。它是后面 RAG、记忆、知识库的基础技术。
微调(Fine-tuning) 用特定领域的数据对模型继续训练,让它在某些任务上表现更好。和 RAG 不同,微调改变的是模型本身的"知识储备"。
04 第二层:能力增强层——Agent 的"手脚、眼睛和记忆"
只有大脑的 Agent 什么都做不了,这一层的名词让 Agent 真正"能干活"。
Function Calling(函数调用 / 工具调用) 让模型在回答过程中"调用外部程序"的机制:模型输出一段结构化指令(比如"调用搜索函数,关键词=XXX"),程序执行后把结果塞回给模型,模型再基于结果继续回答。这是 Agent 能"动手做事"的关键开关。
Tools(工具) Agent 可以调用的外部能力集合:搜索引擎、计算器、代码执行器、数据库、API 接口、甚至其他软件。工具是 Agent 的"手和脚"。
RAG(检索增强生成) 全称 Retrieval-Augmented Generation。核心思路:模型回答前,先从外部知识库"查资料",再把查到的资料连同问题一起交给模型生成回答。作用是引入最新/私有知识、显著减少幻觉(一本正经地胡说八道)。
知识库(Knowledge Base) 存放外部资料的集合,比如公司文档、产品手册、论文。知识库里的文档通常会被切分成小块、向量化后存入向量数据库。
向量数据库(Vector Database) 专门存"向量"并支持快速相似检索的数据库,代表作有 FAISS、Milvus、Chroma、Pinecone。RAG 的"查资料"环节就是在这里完成的。
Memory(记忆) Agent 的记忆分两类:短期记忆(当前对话的上下文,存在上下文窗口里)和长期记忆(把重要信息写入数据库,下次会话还能想起)。记忆让 Agent 从"一问一答"进化为"越用越懂你"。
Planning(规划) 把一个大任务拆成多个小步骤并安排顺序的能力。常见方法包括:
- CoT(思维链)
:让模型一步一步推理,而不是直接给答案;
- ReAct(推理+行动)
:Thought(思考)→ Action(行动)→ Observation(观察结果),循环往复,是目前 Agent 最主流的工作范式;
- Plan-and-Execute
:先定完整计划,再按计划逐步执行。
05 第三层:工程协作层——让 Agent 真正跑起来
单个 Agent 能干活之后,接下来就是"怎么把它做成产品、怎么让多个 Agent 协作"。
Workflow(工作流) 提前把步骤写死的自动化流程:节点固定、顺序固定、每个节点做什么都是人预先设计好的。适合流程稳定的场景(如"每天 9 点抓取数据→生成日报→发送邮件")。
Agent Framework(智能体框架) 帮你开发 Agent 的工具集/平台,比如 LangChain、LlamaIndex、AutoGen、CrewAI,以及国内的低代码平台 Coze(扣子)、百炼等。框架把"调模型、接工具、管记忆、跑循环"这些繁琐事封装好,让你专注业务逻辑。
MCP(模型上下文协议) 全称 Model Context Protocol,由 Anthropic 于 2024 年底开源。它定义了一套"模型如何统一地连接外部工具和数据"的标准协议,可以类比为 “AI 世界的 USB-C 接口”:以前每个工具都要单独对接(协议各异),现在只要工具实现一个 MCP 接口,所有支持 MCP 的 Agent 都能即插即用。
Multi-Agent(多智能体系统) 让多个各司其职的 Agent 分工协作:一个负责拆任务,一个负责查资料,一个负责写初稿,一个负责审核……像一支小型团队。
Orchestrator(编排者/总控) 多智能体系统里的"项目经理":负责理解总目标、把任务拆解分配给各个子 Agent、汇总结果、把控质量。我们日常使用的一些产品背后,就是"总控 Agent + 多个子 Agent"的架构。
Sub-agent(子智能体) 被 Orchestrator 调度、负责执行具体子任务的 Agent。多个子 Agent 可以并行干活,显著提速。
A2A(Agent 到 Agent 协议) Google 于 2025 年发布的 Agent 间通信协议,解决"不同厂商的 Agent 之间怎么对话协作"的问题,与 MCP 互补:MCP 管"Agent 连工具",A2A 管"Agent 连 Agent"。
06 原理一:一个 Agent 是怎么工作的?
把上面名词串起来,一个典型 Agent 的工作循环是这样的:
具体来说分四步:
- 感知
:接收用户请求(问题、指令);
- 规划
:LLM 基于提示词和记忆,把任务拆解成步骤(如用 ReAct 模式);
- 行动
:需要外部信息时,通过 Function Calling 调用工具;需要私有知识时,走 RAG 从知识库检索;
- 观察与迭代
:拿到工具/检索结果,LLM 继续推理,直到任务完成,最后把答案返回给用户。
整个过程是一个"思考→行动→观察→再思考"的循环,而不是一次问答就结束。
07 原理二:关键机制是怎么运作的?
RAG 的运作流程:
一句话总结 RAG:先查资料、再写回答。它解决了 LLM"只懂训练时学过的知识、不知道最新消息和你的私有资料"的痛点。
Function Calling 的时序:
MCP 的架构:
在 MCP 架构里:Host(如你的 Agent 应用)通过 MCP Client 连接 MCP Server,每个 Server 背后挂一个或多个外部数据源/工具。换工具时只需换 Server,Agent 本体不用改。
多智能体协作:
08 一张表看懂:LLM / Workflow / Agent / Multi-Agent 的区别
用一句话记忆:
LLM
是"大脑",只会想和说;
Workflow
是"流水线",路径人定死了;
Agent
是"员工",自己想办法完成任务;
Multi-Agent
是"团队",多个人分工协作。
写在最后
Agent 的生态还在快速进化,今天的热词明天可能就被新协议、新框架取代。但底层的逻辑是稳定的:让模型更强(模型层)、让模型能干更多事(能力层)、让模型能规模化协作(协作层)。
记住这个三层框架,以后再遇到任何新名词,你都能快速找到它在整个图景里的位置。
最后
当下AI大模型是当下实打实的优质风口,岗位缺口大、发展前景广、薪资待遇突出,对比内卷严重、涨薪晋升困难的传统技术岗,是普通人转行逆袭的绝佳选择。
但很多想要入局大模型领域的朋友,都面临无系统学习路径、无实战资源、求职无方向的难题,一个人硬啃最容易走弯路、浪费大量时间精力。这里我结合多年一线实战与教学经验,整理出一套零基础大模型专属资料,包含:
- 系统化学习路线图(零基础到精通)
- 大模型学习书籍 & 文档(电子版)
- 2026 最新行业报告
- 项目实战 & 配套源码
- 大厂面试真题
需要的朋友,微信扫描下方 CSDN 官方认证二维码免费领取,保证 100% 免费。
👇👇扫码免费领取全部内容👇👇
下面简单介绍一下资料包含的内容:
1、大模型系统化学习路线图
专属定制从零基础入门到企业级实战的全阶段学习体系,划分清晰的四大学习阶段,规避碎片化学习弊端,适配新手
2、0基础到进阶视频教程
配套完整高清实操教程,覆盖Prompt提示工程、RAG知识库搭建、Agent智能体开发、模型微调、部署落地等核心知识点,所有课程搭配实操演示,零基础也能轻松看懂、上手实操。
3、大模型学习书籍 & 文档
汇总30+本行业经典AI、大模型、深度学习精选书籍,涵盖理论原理、开发实战、算法基础、AI产品思维等各类内容
4、AI大模型最新行业报告
整理2024-2026年最新大模型行业白皮书、市场分析报告,清晰展现行业发展趋势、技术迭代方向、岗位需求变化,帮助学习者精准把握行业风口,找准学习和就业方向
5、大厂面试真题
汇总了常见的AI大模型面试问题、知识点梳理和面经参考,方便求职时针对性准备。
6、大模型项目实战 & 配套源码
包含GPT应用开发、RAG私有知识库、智能问答系统等多个企业级实战项目,配套完整可运行源码,从简易Demo到完整商业应用全覆盖,帮助学习者将理论转化为落地实战能力,积累项目经验。
7、适合谁学?
- 传统后端 / Java / 前端开发,想转型 AI 应用
- 大学生、应届生,想拿更好的 offer
- 产品经理、运营,想武装职业竞争力
- 技术负责人,想给团队落地提效
学习是反人性的,但回报是真金白银。技术会更新,赛道会切换,但只要你先动手,机会就永远站在你这边。
8、这些资料真的有用吗?
这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。
想要入局AI大模型赛道、抢占行业红利的朋友,微信扫描下方CSDN官方认证二维码,即可100%免费领取全套学习资料!