你问大模型"明天天气怎么样",它只会回答你一个句子;但如果你让它"帮我规划明天的行程,顺便订好酒店和门票",它可能就卡住了。为什么?因为大模型只会"说",而 Agent 会"做"。这篇文章用大白话讲清楚:AI Agent 到底是什么、它和普通大模型的本质区别、主流架构和框架怎么选。
一、先搞清楚:Agent 到底多了什么?
普通大模型(LLM)的本质是"一个会说话的模型"——你输入一句话,它输出一段文字。它没有手、没有脚,也不会去查资料、调接口。
而 Agent(智能体)是在大模型外面加了三样东西:
工具(Tools)——让模型能调用外部能力,比如查天气的 API、搜索的接口、计算器、数据库。
记忆(Memory)——让它记得上下文和之前做过的操作。
循环(Loop)——让它"想一步、做一步、看结果、再想下一步",直到任务完成。
一句话总结:
大模型 = 会回答问题的"大脑";Agent = 有手有脚、能干活、还能自己纠错的"完整的人"。
二、Agent 是怎么"干活"的?核心循环
几乎所有 Agent 都遵循同一个核心循环,业内叫ReAct(Reason + Act,边想边做):
观察(Observation) ↓ 思考(Thought)—— 我现在该做什么? ↓ 行动(Action)—— 调用某个工具 ↓ 观察结果 —— 工具返回了什么? ↓ (回到思考,循环……直到任务完成)举个例子,你让 Agent"帮我查一下某只股票今天涨了没":
思考:我需要先拿到今天的股价数据。
行动:调用"股票行情查询"工具。
观察:工具返回了价格和涨跌幅。
思考:拿到了,直接整理成答案。
输出:最终回答。
这个"想→做→看→再想"的循环,就是 Agent 的"干活"方式。
三、Agent 的六种主流架构
根据你的任务复杂度,Agent 可以搭成不同的"骨架"。我调研整理出最常见的六种:
架构 | 一句话理解 | 适用场景 |
|---|---|---|
单 Agent 循环 | 一个模型自己边想边做 | 简单任务,最容易实现和调试 |
工作流(Workflow) | 按固定步骤顺序执行 | 流程固定、可预测的业务 |
多 Agent 协同 | 多个 Agent 分工合作 | 复杂任务,需要角色分工 |
规划 - 执行(Plan-Execute) | 先列计划,再逐步执行 | 大任务拆解 |
反思(Reflection) | 做完一步,自我检查一遍 | 对质量要求高的任务 |
RAG 增强 | 结合知识库按需检索 | 需要外部知识的问答 |
实际生产怎么组合?
真实系统很少只用一种,通常是组合拳:
工作流编排 + 多 Agent:用 DAG(有向无环图)定义主流程,每个节点是一个独立 Agent。比如代码审查流水线里,代码检查节点是一个 Agent,安全扫描节点是另一个 Agent。
多 Agent + RAG:多个子 Agent 共享同一个知识库,各自按需检索不同内容。
规划执行 + 反思:先规划再执行,每步执行后加反思环节保证质量。
给你的选型建议:不确定就从单 Agent 循环开始,它最容易实现和调试。当上下文窗口不够用时,再考虑多 Agent;需要质量保证时,加反思层;流程稳定后,重构为 DAG 提升可靠性。
四、主流开源框架怎么选?
我调研了当前主流的 Agent 框架,整理成一张对比表(Star 数据为调研时点,含 GitHub 链接),然后逐个拆解每个框架的优势、适用场景和局限。
框架 | GitHub | 特点 | 适合谁 |
|---|---|---|---|
LangGraph | langchain-ai/langgraph | 基于图结构,支持循环和条件分支 | 需要复杂状态机、生产级流程 |
CrewAI | crewAIInc/crewAI | 多 Agent 角色扮演,上手快 | 想快速搭多 Agent 团队 |
AgentScope | agentscope-ai/agentscope | 国产,阿里开源,多 Agent 编排 | 中文场景、多智能体应用 |
Qwen-Agent | QwenLM/Qwen-Agent | 阿里,配套通义千问模型 | 用 Qwen 系列模型 |
Dify | langgenius/dify | 可视化低代码平台 | 不想写太多代码 |
Coze | coze-dev/coze-studio | 字节,可视化搭建 | 快速做应用 |
LlamaIndex | run-llama/llama_index | 主打 RAG 数据框架 | 知识库问答为主 |
Mastra | mastra-ai/mastra | TypeScript 优先 | 前端/全栈开发者 |
n8n | n8n-io/n8n | 工作流自动化工具,支持 Agent 节点 | 企业自动化、跨应用集成 |
AutoGen | microsoft/autogen | 微软,多 Agent 对话框架 | 研究、多 Agent 协作 |
AutoGPT | Significant-Gravitas/AutoGPT | 早期爆款,自主任务拆解 | 探索性任务、实验场景 |
4.1 LangGraph:生产级复杂流程的首选
优势:
图结构灵活:支持循环、条件分支、状态持久化,适合复杂工作流。
生产就绪:LangChain 生态,社区活跃,文档完善,企业案例多。
状态管理:内置状态机,支持回滚、重试、断点续跑。
可观测性:与 LangSmith 深度集成,调试、追踪、监控一站式。
适用场景:
复杂业务流程(如审批流、客服工单流转)。
需要回滚、重试、断点续跑的生产系统。
需要追踪、审计、合规的场景。
局限:
学习曲线陡:图结构概念、状态机设计需要时间掌握。
依赖 LangChain:如果不想绑定 LangChain,会有学习成本。
过度设计风险:简单任务用 LangGraph 可能"杀鸡用牛刀"。
一句话:如果你要做"生产级复杂流程",LangGraph 是首选;如果是简单任务,先试试 CrewAI 或 n8n。
4.2 CrewAI:多 Agent 角色扮演的快速上手方案
优势:
角色扮演直观:定义 Agent 角色(如"研究员""分析师"),自然语言描述任务。
上手快:几行代码就能搭起一个多 Agent 团队。
任务拆解自动:内置任务分配机制,Agent 之间自动协作。
社区活跃:GitHub Star 高,教程多,中文资料丰富。
适用场景:
快速原型验证(MVP)。
多角色协作任务(如"研究→分析→写作"流水线)。
不想深入底层状态机设计的项目。
局限:
灵活性不足:复杂流程控制不如 LangGraph。
调试困难:Agent 之间交互黑盒,问题定位较难。
性能瓶颈:多 Agent 轮次多时,响应速度慢。
一句话:想"快速搭个多 Agent 团队",CrewAI 是最佳起点;需要精细控制时再迁移到 LangGraph。
4.3 AgentScope:国产多 Agent 编排的中文优化方案
优势:
中文友好:阿里开源,文档、示例、社区都是中文。
多 Agent 原生:从设计之初就支持多智能体协同。
分布式支持:内置分布式部署能力,适合大规模应用。
生态整合:与通义千问、阿里云服务深度集成。
适用场景:
中文场景的多智能体应用(如客服、咨询)。
需要分布式部署的大规模应用。
阿里云生态用户。
局限:
国际化不足:英文资料少,海外社区活跃度低。
生态相对新:相比 LangChain/CrewAI,第三方工具集成少。
绑定阿里生态:部分功能依赖阿里云服务。
一句话:中文场景 + 多智能体,优先选 AgentScope;如果要用海外工具链,选 LangGraph/CrewAI。
4.4 Qwen-Agent:通义千问模型的最佳搭档
优势:
模型深度优化:专为 Qwen 系列模型设计,工具调用、推理能力调优。
开箱即用:内置 Qwen 工具库(搜索、代码执行、文档解析)。
阿里生态:与阿里云、通义千问 API 无缝集成。
中文能力强:Qwen 模型本身中文表现优秀。
适用场景:
使用 Qwen 系列模型的项目。
需要中文能力强的 Agent 应用。
阿里云用户,想快速搭建。
局限:
模型绑定:主要优化 Qwen,用其他模型效果打折。
生态封闭:相对封闭,第三方工具集成不如 LangChain 丰富。
社区规模:相比 LangChain/CrewAI,社区小一些。
一句话:用 Qwen 模型,Qwen-Agent 是最佳搭档;用其他模型,选 LangGraph/CrewAI 更灵活。
4.5 Dify:可视化低代码平台的代表
优势:
零代码/低代码:可视化拖拽搭建,非技术人员也能用。
内置模型:支持主流大模型(OpenAI、Qwen、Claude 等)。
应用商店:内置大量模板(客服、写作、数据分析)。
快速上线:几分钟就能搭出一个可运行的 Agent。
适用场景:
非技术团队快速搭建应用。
原型验证、Demo 展示。
简单问答、内容生成类应用。
局限:
灵活性差:复杂逻辑、自定义能力受限。
黑盒运行:调试、追踪能力弱。
成本:高级功能需要付费,大规模使用成本较高。
一句话:不想写代码、快速上线,Dify 是首选;需要深度定制时,选代码框架。
4.6 Coze:字节系可视化搭建平台
优势:
字节生态:与抖音、飞书、微信等字节产品深度集成。
插件丰富:内置大量字节系插件(搜索、视频、电商)。
上手极快:类似"搭积木",拖拽即可完成。
发布便捷:一键发布到抖音、飞书等平台。
适用场景:
字节生态应用(抖音机器人、飞书助手)。
快速搭建、快速发布。
内容创作、电商场景。
局限:
平台绑定:强绑定字节生态,迁移成本高。
功能受限:复杂逻辑、自定义能力弱。
封闭性:相比开源框架,可控性差。
一句话:要做"字节系应用",Coze 是首选;要跨平台、灵活定制,选开源框架。
4.7 LlamaIndex:RAG 数据框架的专家
优势:
RAG 专精:从数据加载、切片、索引到检索,全流程优化。
数据源丰富:支持 PDF、Word、Notion、数据库等 50+ 数据源。
检索能力强:内置多种检索策略(向量、关键词、混合)。
与大模型解耦:不绑定特定模型,灵活切换。
适用场景:
知识库问答、企业文档检索。
需要高精度检索的场景。
数据源复杂、需要多格式解析。
局限:
非完整 Agent:专注 RAG,工具调用、多 Agent 等能力弱。
学习曲线:索引、检索概念需要理解。
性能开销:大规模数据索引、检索有延迟。
一句话:做"知识库问答",LlamaIndex 是专家;要做完整 Agent,配合 LangGraph/CrewAI 使用。
4.8 Mastra:TypeScript 全栈开发者的选择
优势:
TS优先:TypeScript 原生,前端/全栈开发者上手快。
现代栈:支持 Next.js、Vercel AI SDK 等现代工具链。
轻量灵活:不绑定特定模型或平台。
前端友好:与前端框架深度集成,适合 Web 应用。
适用场景:
前端/全栈项目(Next.js、React)。
TypeScript 技术栈团队。
需要 Web 界面交互的 Agent 应用。
局限:
生态新:相比 Python 框架,社区、插件少。
中文资料少:主要英文文档。
成熟度:还在快速发展期,API 可能变动。
一句话:TypeScript 全栈项目,Mastra 是首选;Python 为主,选 LangGraph/CrewAI。
4.9 n8n:企业流程自动化的工作流工具
优势:
可视化拖拽:节点式工作流,非技术人员也能用。
300+ 集成:内置 Slack、Notion、Google Sheets、GitHub 等。
自托管友好:开源版本可自部署,数据可控。
Agent 节点:支持调用大模型做智能决策。
适用场景:
企业跨应用自动化(如"邮件→数据库→通知")。
业务流程自动化(审批、数据同步)。
不想写代码的团队。
局限:
非纯 Agent:核心是工作流,Agent 只是其中一环。
复杂推理弱:不适合需要深度推理的场景。
性能:大规模并发时性能不如代码框架。
一句话:企业流程自动化,n8n 是首选;智能决策 + 复杂推理,选 LangGraph/AutoGen。
4.10 AutoGen:微软多 Agent 对话研究框架
优势:
多 Agent 对话:Agent 之间可以"对话"协作,模拟人类团队。
研究前沿:微软研究院出品,学术价值高。
灵活扩展:支持自定义 Agent、工具、对话策略。
多模态:支持图像、代码、文本多模态交互。
适用场景:
研究、实验性项目。
多 Agent 对话协作场景。
需要高度自定义的复杂系统。
局限:
学习曲线陡:概念多,配置复杂。
稳定性:研究项目,生产稳定性不如 LangGraph。
文档:英文文档为主,中文资料少。
一句话:研究、实验、多 Agent 对话,AutoGen 是首选;生产稳定系统,选 LangGraph。
4.11 AutoGPT:早期爆款的自主任务拆解探索
优势:
自主任务拆解:给定目标,自动拆解成子任务并执行。
开源社区:早期爆款,社区活跃,衍生项目多。
探索性强:代表"自主 Agent"方向,适合研究。
适用场景:
探索性任务(如"研究某个主题并写报告")。
实验、原型验证。
学习 Agent 自主任务拆解。
局限:
不稳定:容易陷入循环、死锁。
不可控:自主性强但可控性差。
生产风险:不适合生产环境。
一句话:探索"自主 Agent"方向,AutoGPT 是经典案例;生产环境慎用。
怎么选?给你三个判断标准
看你的技术栈:
Python 为主 → LangGraph / CrewAI / AutoGen
TypeScript 为主 → Mastra
不想写代码 → Dify / Coze / n8n
看任务复杂度:
简单任务(问答、内容生成)→ Dify / Coze
中等复杂度(多 Agent 协作)→ CrewAI / AgentScope
复杂流程(状态机、回滚、审计)→ LangGraph / AutoGen
看语言场景:
中文 + 多智能体 → AgentScope / Qwen-Agent
国际化 → LangGraph / CrewAI / AutoGen
字节生态 → Coze
阿里云生态 → Qwen-Agent / AgentScope
五、总结
大模型会"说",Agent 会"做"——Agent = 大模型 + 工具 + 记忆 + 循环。
核心是ReAct循环:观察→思考→行动→看结果→再思考。
架构从单 Agent 循环起步,按需升级到多 Agent、反思、RAG。
框架选型看技术栈 + 复杂度 + 语言场景,没有银弹。