本文通过15张原理图详细解析了大模型Agent的运作机制,从LLM加工具、加记忆、加规划被循环串联的内部结构入手,深入剖析了Agent在单轮任务中从目标到工具调用的完整流程。文章重点讲解了数据流经的各个环节,包括上下文装配、LLM决策、动作解析、工具执行、结果回填与判定等,并揭示了LLM无状态特性对Agent设计的影响。此外,还探讨了Agent循环终止的条件、记忆分层的实现方式以及Agent的认知边界等关键问题,帮助读者全面理解Agent的运作原理,为实际应用打下坚实基础。
你能说出 Agent 是什么:LLM 加工具、加记忆、加规划,被一个循环串起来。但如果有人接着问一句——那一轮里,从你的目标进去,到某个工具真正被调用,中间到底发生了什么?多数人会卡在这儿。不是不懂,是没见过它被拆开的样子。
这篇不讲概念,用 15 张原理图把这条链从头拆到尾。看完你应该能自己画出来。
关于这些图|封面那张是横版原图,放进文章里字会缩得看不清,所以下面这 15 张都转成了竖版重画。
一、先建立坐标:四个部件,一个循环
先记住这张。后面 14 张不是把它放大,而是逐个剖开每个环节的内部机制——数据在里面怎么流、状态怎么变、哪一步是模型做的、哪一步是你的代码做的。
四个部件里,只有大脑(LLM)会做决策,其余三个都是被它调用的资源:手脚(工具)连外部世界,记忆存已经发生的事,规划把大目标拆成小步。底部那行是能证伪的部分——缺大脑,它退化成写死的脚本,那叫工作流不叫 Agent;缺手脚,只能闭眼聊天;缺记忆,第二步不知道第一步干了啥,多步任务必散架;缺规划,要么乱走要么原地绕圈。四块缺一不可,不是凑数的定义。
二、一字之差:谁决定下一步
同一个会幻觉的 LLM,上下两条路的区别只有一个:下一步做什么,谁说了算。
单次问答里是你说了算——你问一句,它答一句,然后停。Agent 里是它自己说了算:它看着当前状态决定下一步调什么工具,拿到结果再决定下一步,直到它认为完成。这就是「自主性」。它全部的能力来自这个,它全部的麻烦也来自这个。
三、一轮里到底发生了什么
这是全篇的心脏,也是最值得点开逐条追的一张。一轮=上下文装配 → LLM 一次前向 → 动作解析 → 工具执行 → 观察结果 → 判定,编号 1 到 7 就是数据流经的顺序。
图里那句红字是最容易被忽略的:LLM 是无状态的。它不记得上一轮说过什么,历史全靠这一轮的 prompt 重新带一遍。用后端的话说,它是个彻底无状态的服务,每次调用都得把全量状态当入参传进去——你以为的「它记得」,其实是你(或框架)每轮都重新塞了一遍。
三条带小数点编号的支线才是这张图的深处:5.1 解析失败不是终点,它把报错当成一次观察回填给装配环节,让模型下一轮自己改;6.1 危险动作在沙箱那一层就被拒绝,根本走不到真实调用;9.3 转太多轮强制收尾。它们不是补丁,是这个循环能跑在生产上的前提。
四、上下文每一轮是怎么拼出来的
同一个目标跑三轮,prompt 里真正变的只有红色那一段——已经走过的「想法/动作/结果」,其余几段每轮都一样。但红色那段每轮都在变长。
这就是 token 越烧越多的真正原因:不是模型变贵了,是你每轮都把整条 prompt 重新交给它读一遍,而这条 prompt 每轮都比上一轮长。所以「让 Agent 少走弯路」不只是准确率问题,它直接决定下一轮的输入有多长、多贵。图的下半段是撞上窗口上限之后的三条出路——截断最老的、摘要压缩、沉淀进长期记忆,它们都在拿「信息完整度」换「还能不能继续跑」,没有免费的压缩。
五、模型吐出来的到底是什么
这张是本篇信息密度最高的一张,三段真实 JSON 摆在一起:左边是你注册工具时给模型的说明书(input_schema),中间是模型的输出(一个tool_use块,含id/name/input),右边是你回填的结果(tool_result,靠tool_use_id配回去)。
模型从头到尾没有执行任何东西。它只吐了一段结构化文本。get_weather是你的代码调的,参数校验是你做的,沙箱是你套的。中间那列黄块是纪律:input的 JSON 转义在不同模型上可能不同,必须用 JSON 解析,不能拿字符串匹配。这条踩过的人才知道疼。
六、为什么「想」和「做」必须交织
ReAct 就是把思考塞进每一步决策里:想 → 做 → 看,三段一组反复循环(Yao et al. 2022)。右边是一条真实轨迹:先查周杰伦哪年生,拿回 1979;第二步用的是第一步真查回来的 1979,而不是模型脑补的年份,于是查到卡特。
两边的死穴都在图上:纯推理拿不到外部事实,想到一半只能瞎编;纯行动不会规划,看到报错也不知道换什么策略,只会机械重试。交织的价值就是让它俩互相纠正——推理决定调哪个工具,观察修正下一步的推理。
七、一轮里要调两个工具怎么办
模型可以在一条消息里同时要求调多个工具。这时候id的作用才真正显出来:谁的结果是谁的,全靠它。
两个坑写在图下面。一是两个结果必须放进同一条 user 消息里回填,拆成两条发回去,模型下次就不再并行调用了——它会以为并行不被接受。二是某个工具失败也要回填(带is_error),不能直接丢掉;少一个结果,这一轮就配不齐。
八、这个循环凭什么会停
三条:模型自己说完成了、撞上轮数上限(max_iterations,典型设 10~25 轮)、连续报错或超预算熔断。第一条是正常出口,后两条是保险丝。
保险丝不是可选项。模型自己不会知道「我已经绕了 20 轮」——它每一轮都觉得当前这个决定是合理的。这跟你给下游调用加超时和熔断是同一件事:不是因为它一定会挂,是因为它挂的时候你得能停下来。
九、什么时候想、想多少
同一个循环骨架,换一种「什么时候调用大脑」的策略,性格完全不同。ReAct 每步现场决策,适应性强,但每步一次大模型调用,贵且容易绕圈;Plan-and-Execute 先一次性列出完整步骤表,执行时不再问大脑,省调用、大目标不易跑偏,代价是计划僵硬,现实一变就得重规划;Reflexion 是另一个维度——失败后把原因反思成文字写进记忆,带着教训重试。
一句话取舍:环境越确定越偏 Plan-and-Execute,越是探索性任务越偏 ReAct;Reflexion 可以叠在前两种之上。
如何学习大模型 AI ?
由于新岗位的生产效率,要优于被取代岗位的生产效率,所以实际上整个社会的生产效率是提升的。
但是具体到个人,只能说是:
“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。
这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。
我在一线科技企业深耕十二载,见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事,早已在效率与薪资上形成代际优势,我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套AI 大模型突围资料包:
- ✅ 从零到一的 AI 学习路径图
- ✅ 大模型调优实战手册(附医疗/金融等大厂真实案例)
- ✅ 百度/阿里专家闭门录播课
- ✅ 大模型当下最新行业报告
- ✅ 真实大厂面试真题
- ✅ 2026 最新岗位需求图谱
所有资料 ⚡️ ,朋友们如果有需要《AI大模型入门+进阶学习资源包》,下方扫码获取~
① 全套AI大模型应用开发视频教程
(包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点)
② 大模型系统化学习路线
作为学习AI大模型技术的新手,方向至关重要。 正确的学习路线可以为你节省时间,少走弯路;方向不对,努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划,带你从零基础入门到精通!
③ 大模型学习书籍&文档
学习AI大模型离不开书籍文档,我精选了一系列大模型技术的书籍和学习文档(电子版),它们由领域内的顶尖专家撰写,内容全面、深入、详尽,为你学习大模型提供坚实的理论基础。
④ AI大模型最新行业报告
2025最新行业报告,针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。
⑤ 大模型项目实战&配套源码
学以致用,在项目实战中检验和巩固你所学到的知识,同时为你找工作就业和职业发展打下坚实的基础。
⑥ 大模型大厂面试真题
面试不仅是技术的较量,更需要充分的准备。在你已经掌握了大模型技术之后,就需要开始准备面试,我精心整理了一份大模型面试题库,涵盖当前面试中可能遇到的各种技术问题,让你在面试中游刃有余。
以上资料如何领取?
为什么大家都在学大模型?
最近科技巨头英特尔宣布裁员2万人,传统岗位不断缩减,但AI相关技术岗疯狂扩招,有3-5年经验,大厂薪资就能给到50K*20薪!
不出1年,“有AI项目经验”将成为投递简历的门槛。
风口之下,与其像“温水煮青蛙”一样坐等被行业淘汰,不如先人一步,掌握AI大模型原理+应用技术+项目实操经验,“顺风”翻盘!
这些资料真的有用吗?
这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。