【AI Agent实战】从原型到生产:AI Agent 可观测性与评估体系深度解析——构建企业级可信赖 AI 系统的完整指南
2026/8/15 9:45:24
网站建设
项目流程
文章目录
- 一、为什么"能跑"和"能上线"是两回事
- 1.1 一个残酷的现实
- 1.2 原型 vs 生产:一张表看懂差距
- 二、Agent 部署模式详解
- 2.1 三大部署模式概览
- 模式一:客户端托管 Agent(Client-Hosted)
- 模式二:托管 Agent(Foundry Agent Service / Hosted Agents)
- 模式三:Agent 工作流(Agent Workflows)
- 2.2 三种模式的架构对比
- 三、Agent 完整生命周期管理
- 3.1 生命周期不是一次性的 push
- 3.2 各阶段详解
- 阶段一:创建/编写(Create / Author)
- 阶段二:版本化(Version)
- 阶段三:离线评估(Evaluate Offline)⭐ 关键环节
- 阶段四:部署(Deploy Hosted)
- 阶段五:在线观测(Observe Online)
- 四、可观测性体系(Observability)
- 4.1 核心原则:无法观测就无法运营
- 4.2 OpenTelemetry 集成实践
- 4.3 Span 属性的价值
- 五、扩展策略(Scaling Strategies)
- 5.1 为什么扩展 Agent 与扩展 Web API 不同
- 5.2 技术一:无状态请求处理
- 5.3 技术二:模型路由(Model Routing)
- 5.4 技术三:响应缓存(Response Caching)
- 5.5 技术四:并发控制和背压
- 六、成本优化策略
- 6.1 成本由 Token 主导
- 6.2 评估门禁与成本控制的关系
- 七、企业级部署考量
- 7.1 治理(Governance)
- 7.2 人工审批(Human-in-the-Loop)
- 7.3 MCP 生产环境集成
- 八、实战案例:生产级客户支持 Agent
- 九、冒烟测试(Smoke Tests)
- 9.1 为什么需要冒烟测试
- 9.2 冒烟测试管道
- 9.3 测试目录结构
- 9.4 测试金字塔
- 十、常见问题解答(FAQ)
- Q1:生产 Agent 中"模型"占多大比例?
- Q2:何时选择托管 Agent 而非客户端托管?
- Q3:为什么可扩展的 Agent 必须在自己的进程内存中是无状态的?
- Q4:模型路由解决什么问题,它与评估有什么关系?
- Q5:什么是"评估门禁",它位于生命周期的哪个位置?
- Q6:为什么在生产中将 MCP Server 视为不受信任的边界?
- Q7:哪个单一更改通常对生产 Agent 成本影响最大,为什么?
- Q8:像 `customer.tier` 和 `routed.model` 这样的 span 属性在可观测性中起什么作用?
一、为什么"能跑"和"能上线"是两回事
1.1 一个残酷的现实
在前面的文章中,我们学会了在 Jupyter Notebook 中构建各种 AI Agent:
- ✅ 能调用工具
- ✅ 能做 RAG 检索
- ✅ 能多 Agent 协作
- ✅ 能自我反思
但是——当你的老板问:"这个 Agent 能不能支撑每天 10 万次请求?出了问题怎么排查?成本怎么控制?"的时候,你会发现:
Notebook 里跑通的 Agent,距离生产环境还差着 80% 的工程工作。
1.2 原型 vs 生产:一张表看懂差距
| 关注维度 | 原型阶段 | 生产环境 |
|---|
| 托管方式 | 在你的 Notebook 里运行 | 作为托管服务运行,版本化管理 |
| 身份认证 | 你的az logintoken | Managed Identity |