如何画架构图实战:以智能客服系统为例画技术(系统)架构
2026/7/22 2:47:23 网站建设 项目流程

没有业务架构时,先别急着画技术架构

上一篇有个判断:

技术架构不能凭空画,业务架构应该是技术架构的输入。

放在成熟团队里,这个条件成立。

麻烦在于,很多公司没有这个输入。

有些团队压根就没有过业务架构图。

有些业务刚开始做,产品文档还在改。

有些老系统跑了几年,业务边界早被需求冲散。

没人能拿出一张业务架构图。

但我们不能卡在这里,然后跟老板说需要你给我一张业务架构。

这时要先梳理核心业务流程。

你要沿着这条线,把状态归属、同步边界、模块关系、异常兜底和支撑能力一步步梳理出来。

动手之前:先识别关键需求

在梳理核心业务流程之前,还有一个更前置的问题:这个系统的关键需求是什么?

这里先说一个结论:关键需求决定架构,其余需求验证架构。

放在 AI 客服这个场景里,关键需求至少有三类。

第一类是关键功能性需求。

用户从提问到拿到有效回复,这条链路必须走通。

如果这条链路走不同,系统就没有存在的业务价值。

这是最长的职责协作链,也是架构的主心骨。

第二类是关键非功能需求,也叫质量足球。

端到端响应延迟要控制在2秒以内。

服务可用性不能低于 99.9%。

同时支持1w并发。

多租户之间的数据必须严格隔离。

这些是硬性约束。

任何一个没满足,就无法满足设计预期。

第三类是关键约束、限制。

公司已经有的订单系统、CRM、物流系统,接口协议等都不是我们能随意更改的。

数据合规要求也摆在那里,不能绕过。

必须要选择某个中间件、数据库等,比如信创要求。

这三类关键需求,决定了核心域包括会话、机器人编排、知识检索,运营看板、数据报表、训练平台等只能归到非核心域。

也决定了为什么外部依赖必须画在边界外,并且要有熔断降级、支持横向扩展。

关键需求没想清楚,后面画的每一个框都缺乏依据。框摆得再整齐,也只是系统清单。

第一步:梳理核心业务流程,先把用户怎么进来画清楚

AI 客服这类系统,先画一条最核心的用户路径:

用户发起对话。

系统识别租户、用户身份和机器人配置。

会话被创建或恢复。

用户消息进入会话服务。

机器人编排判断路径。

可能查 FAQ。

可能走知识库检索。

可能调用订单、物流、退款这些业务系统。

也可能转给人工坐席。

系统把结果返回给用户。

会话记录、质检数据、日志和运营分析在后面处理。

这一步的产出,是架构图的主线。

有了这条线,每个模块都要回答:

我服务于这条链路的哪一段?

有些模块重要,但不在主线上,就先放在一边。

比如数据看板很重要,知识运营也很重要,但用户等回复时,这些模块不是核心。

第二步:标出状态机流转和数据归属

很多图看着像技术架构图,但实际上只能回答有哪些服务。

一到评审,别人问核心状态流转、数据流向等,单纯一张图就撑不住,需要额外对着图讲一通。

画图的人要回答的是两个问题:

状态怎么变?

数据从哪里来到哪里去?

前者是状态流转。

后者是数据归属。

AI 客服系统里,至少要把几类关键状态标出来。

会话状态:

新建 → 机器人处理中 → 已回复 / 待人工 → 人工处理中 → 已关闭。

这条状态线,应该由会话服务维护,最终落到会话库。

坐席系统、质检系统、运营看板可以读取会话状态,也可以消费会话事件,属于下游系统。下游系统一般不会修改上游系统,否则会出现几套状态互相打架。

消息状态:

已接收 → 处理中 → 已发送 / 发送失败 → 用户已读。

消息状态应该以消息表或消息日志为准。

质检分析、数仓宽表、运营报表,都是从消息记录加工出来的结果。

知识库状态:

草稿 → 待审核 → 已发布 → 已下线。

这里还要多画一个索引状态:

待切片 → 向量化中 → 索引构建中 → 索引可用。

知识内容和版本,以知识管理系统为准。

向量库、搜索索引、召回缓存,只是为了服务于检索加速或提升准确度。

可能会有延迟,可能会重建,也可能短时间和知识管理系统不一致。

所以图上要标清楚:

知识是否发布,要以知识管理系统为准。

知识能否被机器人检索到,还要看索引状态是否编程可用。

工具调用状态:

待调用 → 调用中 → 成功 / 失败 / 超时 → 待重试。

工具调用结果,要看业务系统返回、调用流水和幂等记录。

比如查订单、查物流、发起退款,最终结果都应该以业务系统返回为准。

这一步做完,技术架构图里就不只是有框了。

每个关键状态由谁维护、谁能更新、谁只是读取副本,开始有边界了。

后面讨论故障恢复、补偿任务、对账逻辑时,就不至于纯靠拍脑袋。

比如知识库已发布,但索引还在重建。

这时客服机器人能不能用新知识?

如果回答错了,是知识管理系统的问题,还是索引构建的问题?

第三步:判断同步和异步边界

判断同步异步,要显式的思考并标记出来,不能做的时候在考虑。

用户提问到拿到回复,走同步链路还是异步,要看关键质量需求里,响应延迟是2秒以内的硬约束。

主线和状态有了,再判断哪些动作要让用户等待。

AI 客服里,用户提问到拿到回复,通常在同步链路上。

渠道到接入网关。

接入网关到会话服务。

会话服务到机器人编排。

机器人编排到知识检索、工具调用或模型服务。

结果回到会话服务,再返回用户。

这条线是核心链路,要加粗。

它是用户等待路径。

但用户等待路径不能什么都塞。

会话日志落库可以先保证主记录,后续分析异步。

质检分析可以异步。

训练样本沉淀可以异步。

运营看板统计可以异步。

满意度和解决率这类业务效果指标,也不应该抢用户等待链路。

它们可以从会话结束事件、人工接管事件、用户反馈事件里异步计算。

这一步图上要做三件事:

同步调用用实线。

异步消息用虚线。

数据同步用点线或单独标注。

线上不要只写调用两个字。

能具体就具体。

比如 HTTP,超时三秒,失败降级到备用模型。

比如 MQ,会话结束事件,消费者幂等键是 session_id。

比如知识索引,发布后异步重建,允许分钟级延迟。

同一根箭头,有人默认同步调用,有人默认 MQ,有人默认可以重试,有人默认失败就丢。

箭头不说清楚,争论就会从图上转到口头。

第四步:把模块摆回技术架构骨架里

到这里,才开始把模块摆回技术架构图。

第一篇讲的分层、分域、模块、关系,这时就派上用场了。

我一般先画四层主架构,再把旁路能力和外部边界放进去。

第一层是接入层。

App、Web、小程序、企微、电话/予以你、开放 API 放在这里。

第二层是接入与会话层。

接入网关、鉴权、限流、协议适配、会话服务、上下文管理、消息记录放在这里。

第三层是核心业务能力层。

这里不要按微服务名平铺,要先在这一层里画一个独立内框,再按业务域摆模块。

这个独立内框要和上下两层留出边界,不要贴着接入层和数据层画。

会话域:会话创建、消息收发、上下文管理、会话状态。

对话机器人域:意图理解、策略编排、prompt管理、上下文管理、模型路由、回复生成。

知识域:知识管理、文档解析、索引、检索、向量库。

工具集成域:业务系统连接、接口编排、权限控制、结果封装。

人工服务域:转人工、坐席工作台、工单、服务记录。

但要注意,人工服务域不是和知识域、工具域完全并列的常规查询路径。

知识和工具更像并行能力。

人工是条件跳转,是兜底和接管。

图上最好用不同线型表达出来,别让读者误以为三者地位完全一样。

第四层是数据与中间件层。

会话库、消息日志、知识库、向量库、搜索索引、缓存、MQ、对象存储、数据同步。

分层之外,再放三个旁路和边界。

左侧靠近分层标签的位置,放支撑与治理平面。

监控、日志、链路追踪、告警、配置、注册、灰度、开关、任务调度、审计。

效果评估要拆开看,不要随手塞进支撑平台里。

模型调用成功率、响应耗时、召回命中率,可以放在技术观测侧。

满意度、解决率、转人工率,更像业务效果分析,适合放在右侧的运营与分析域,不要和监控告警混成一团。

运营与分析域是系统内部能力,但不在用户等待主链路上。

它消费会话数据、消息日志、质检结果和成本数据,再反哺知识、策略和模型评估。

最右侧是外部依赖,也就是风险入口。

大模型供应商、语音服务、CRM、订单系统、物流系统、工单系统、短信服务,都放在边界外。

这些外部系统不是可选组件,而是关键约束。

它们的存在直接决定了工具集成域必须独立成域。

也决定了熔断、降级、幂等不是架构洁癖,而是外部系统的可用性不受我们控制,必须用技术手段解决。

这两个位置一定要分清。

一个是你自己系统的支撑能力。

一个是你无法完全控制的外部边界。

很多图在这里画乱,是因为内部支撑和外部依赖混在一边。

一旦模型供应商超时、CRM 接口抖动、语音服务不可用,团队不知道该看内部告警,还是该走外部故障预案。

第五步:补异常、风险和支撑能力

生产环境里,核心流程从来不是最难画的。

难的是失败以后谁兜底。

AI 客服这类系统,我会在主图上至少标四类异常。

第一类,模型超时。

机器人编排到 LLM 网关这条线,要标超时、重试、熔断、备用模型和兜底回复。

不要只写外部模型。

评审时要追到这些细节:

用户最多等几秒?

超时后是换模型、降级模板回复,还是转人工?

第二类,知识未召回。

知识服务到向量库、搜索索引这条线,要标知识版本、索引延迟、召回阈值和兜底策略。

如果召回结果不可信,是澄清问题,还是转人工?

第三类,幻觉、工具调用失败、未调用。

调用订单、退款、物流这类业务系统时,要标权限、幂等、超时、失败提示。

这里有一条红线:

工具调用失败,一定要有明确的降级规则

第四类,转人工失败、上下文丢失。

会话服务到坐席工作台这条线,要标上下文包、转接状态、人工接管事件。

坐席接手时看不到前面几轮对话,技术上不一定会触发 P0,但客户体验会明显变差。

这些异常标完,再把支撑能力补上。

限流、鉴权、防刷放在接入侧。

重试、幂等、熔断、降级放在业务链路旁。

日志、监控、链路追踪、告警放在支撑侧。

审计、脱敏、备份、补偿任务放在数据侧。

这样画出来的主图,仍然是技术架构图。

主图成型以后,不要硬塞所有细节

主图基于核心链路确定之后,不要急着往下拆。先用其余需求来验证这个骨架是否足够包容。

运营看板需要消费会话数据,当前架构有没有暴露合适的事件或接口?

知识运营后台需要独立的审核流程,会不会污染核心链路的状态机?

训练平台要回流样本,会不会反向干扰线上推理?

如果其余需求在主图上找不到落点,或者需要扭曲核心架构才能硬塞进去,说明主图的模块边界或分层有问题。这时候应该回退调整,而不是在细化层打补丁。

这正是关键需求决定架构,其余需求验证架构的闭环。

主图不是一张面面俱到包含所有细枝末节的图。

一张图要建立全局共识,不要承担所有解释工作。

什么时候该拆下一层?

我一般看四个点。

第一,线已经开始交叉,读者的视线跟不住。

不一定非要数到五条交叉线才拆。

但如果你讲图时需要不停用鼠标绕来绕去,这张主图已经过载了。

第二,同一个领域里,有超过三个状态要解释。

比如会话域既有机器人处理中、待人工、人工处理中、已关闭,又有超时、撤回、重复消息,就应该拆会话状态图。

第三,某条链路里有多个异常分支。

比如知识发布涉及上传、解析、切片、索引、灰度、回滚,主图里只留知识域和风险标注,细节拆知识发布图。

第四,评审时连续围绕同一块内容讨论。

如果大家一直追问 prompt、RAG、工具调用、模型路由,就别在主图上硬解释,拆机器人编排逻辑的详图。

对 AI 客服来说,常见的下一层图有四张:

会话状态和消息流转图。

机器人编排与模型路由图。

知识入库、索引、发布和回滚图。

转人工和上下文传递图。

第一张图负责建立全局。

第二张图负责讲清领域。

第三张图负责解释关键链路。

第四张图才落到实现细节。

验证关键需求是否满足

这一步需要根据最开始的关键需求确认:

这个架构是否满足所有关键功能需求?

核心链路有没有遗漏一票否决的功能?

是否满足所有关键质量需求?

延迟、可用性、安全、扩展性是否可度量、可验证?

是否满足所有关键约束?

遗留系统对接、合规要求、技术栈限制是否都有明确的落点?

如果答案都是肯定的,说明架构设计合格。

如果评审中发现某个关键需求无法被满足,不要试图在细化层打补丁,要回退到概念架构阶段重新调整。

这些问题能在图上被讨论清楚,图才有价值。

如果每个问题都要靠画图的人口头补充,说明这张图画的还不够到位。

结语

第一篇讲的是骨架。

分层、分域、模块、关系、支撑能力。

第二篇讲的是脉搏。

主链路、状态、同步边界、异常兜底、拆图策略。

骨架和脉搏不是凭空来的。

它们来自对关键需求的识别,来自关键需求对架构的裁剪,也来自其余需求对架构的验证。

画架构图,不是在训练大家把框画得多整齐。

是在让团队把这些问题摆到桌面上:

业务结果是什么?

关键需求有哪些?

系统主线怎么走?

状态以谁为准?

失败时谁兜底?

这块谁负责?

如果一张图能让这些问题被讨论清楚,它就有价值。

如果它只是把所有系统或应用摆上去,再好看也只是系统清单。

下次你准备画一张技术架构图,可以先不急着打开工具。

先拿一条真实链路问自己:

用户从哪里进来?

系统第一跳到哪里?

关键需求是什么?

状态落在哪里?

失败时谁兜底?

其余需求能不能在这个骨架上自然生长?

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询