六种 Workflow 组织形状,以及如何组合
2026/7/21 17:37:24 网站建设 项目流程

Anthropic 和 LangChain 都整理过一组常见 pattern。它们不是产品开关,更像任务几何的解法:工作集是否已知、对象是否同质、误报是否昂贵、方案空间大不大、比较是绝对还是相对、范围能不能事先框死。弄清形状,比背功能名管用。

也可以把六种模式当成积木。真正值钱的很少是单独一块,而是怎么搭。下面先把每块看透,再谈组合顺序、错配代价和选型。

六种组织形状总览:分类再派发、铺开再收拢、发现再验证、生成再过滤、两两打擂台、循环到停止

分类再派发、铺开再收拢、发现再验证、生成再过滤、两两打擂台、循环到停止

先分类,再派专家:Classify and act

混合输入不该塞给同一个角色。工单里既有缺陷,也有需求,还有咨询;日志里既有配置错误,也有权限问题;用户反馈里既有产品建议,也有安全投诉。先分类,再路由到不同专家子智能体,最后按类汇总。

适用信号很清楚:同一批次里,处理逻辑明显分叉。如果硬用同一个 prompt 处理全部,模型会在「像缺陷」和「像需求」之间摇摆,输出字段也不稳定。分类的价值,是把异质问题重新变回同质子问题,后面才能安全地 fan-out。

分类阶段值得单独做干净。分类错了,后面再并行也只是把错误放大。必要时给分类结果留一刀校验:抽检低置信类别,或让第二个分类器对边界样本复判。也不要把分类器做成无限细的标签树。标签太多,路由会碎,专家子智能体反而难沉淀。

反模式是「先并行,再在总结时分类」。那样每个子任务已经按错误假设处理过一遍,总结阶段只能做文案归类,救不回处理逻辑。

先铺开,再收拢:Fan-out and synthesize

同类工作作用于大量独立对象时,最自然的形状是:每个对象一个子任务,并行执行,最后合成一份总报告。代码目录审查、批量文档摘要、多源材料收集、按文件迁移,都属于这类。

有两点比较关键。

工作集要先显式列出,否则「铺开」没有边界。没有列表,就没有覆盖证据。

合成步骤最好是屏障:等全部 fan-out 结束,再按统一协议合并,而不是边跑边用主上下文消化全过程。每个局部任务最好拥有干净上下文,避免互相污染。合成也不是拼接,而是过滤、去重、排序、留证据。

Fan-out 解决的是覆盖和吞吐,不自动解决误报。如果你得到很多「看起来像问题」的条目,下一步通常要接验证,而不是直接当结论发布。很多人把 fan-out 当成 workflow 的全部,最后只是更快地得到一份更长的未校验清单。

还有一个实现细节:对象之间真的独立吗?如果文件 A 的改法取决于文件 B 的接口决策,盲目并行会制造冲突。这时要先做分层:先共享决策,再 fan-out 执行;或按依赖批次推进。Fan-out 假设的是可并行单元,不是任意切片。

先召回,再独立证伪:Adversarial verification

误报成本高时,发现和验证必须拆开。第一遍尽量扩大召回,找出可疑项;第二遍把每个可疑项送给独立验证者,验证者重新读证据,返回确认或驳回;只有存活下来的结果进入终稿。

这直接针对 self-preferential bias。验证者不继承发现者的自我辩护路径,上下文隔离本身就是机制,不只是角色扮演。安全审计、合规检查、事实核查、关键架构结论,都适合这个形状。Claude Code 的 deep research 思路也接近:多角取证之后,对声明做交叉核验,再合成带引用报告。

验证者的提示词应该逼它寻找否定证据,而不是复述发现者的理由。更稳的做法是只给验证者「原始证据定位 + 待验证声明」,不给发现者的长篇论证。否则隔离会被叙述穿透。

代价是更贵、更慢。换来的是置信度,不是速度。如果业务更在乎召回、能接受人工二次筛选,可以减弱验证强度;如果误报会直接进入阻断决策,验证就不该省。也要分清「验证失败」和「验证驳回」:后者是判断为不成立,前者是没跑成。官方文档后来把未完成核验标成 unverified,而不是当成 refuted,就是在避免这种账目错误。

先发散,再过滤:Generate and filter

方案空间大时,一上来就押一个答案往往更差。可以并行生成多个候选——不同架构、不同实现、不同文案——再按同一套标准打分、去重、过滤,只保留少数高分结果。

和 fan-out 的差别在于:fan-out 通常是「同一类检查作用于很多对象」;generate-and-filter 是「同一问题产生多个竞争解」。前者扩覆盖,后者扩搜索。

过滤标准要事先写清,否则最后只是在多个漂亮答案里凭感觉挑一个。标准最好能落到结构化字段:正确性、复杂度、可运维性、兼容成本。过滤层可以是脚本规则,也可以是另一个子智能体;但评分字段要能排序,不能只是一段印象派评语。

命名、设计探索、重构策略、限流方案对比,都常见这个形状。反模式是生成很多候选,却不隔离输出位置,结果互相覆盖;或生成后仍回到主模型自由发挥「我更喜欢哪个」,把过滤阶段重新变回单上下文品味裁决。

不打绝对分,改打擂台:Tournament

有些好坏很难绝对打分,却比较容易两两比较。风格选择、主观品味、多个实现「哪个更干净」,都属于这类。做法是让多个候选进入淘汰赛,由评判者做 pairwise 比较,胜者晋级,直到留下冠军或 Top N。

Anthropic 特别强调过:相对判断常常比绝对打分稳。一千行支持工单按严重度排序,硬让一个上下文直接排序,质量会塌;拆成比较管线或分桶再合并,更符合模型实际能力。人做评审时也常有类似现象:问「这件有多严重」波动很大,问「这两件哪个更严重」稳定得多。

Tournament 贵,因为它比较次数会随候选数上升。候选很多时,先用 generate-and-filter 粗筛,再对前几名打擂台,通常更划算。也可以先分桶:高、中、低三档内比较,再合并,避免全量两两爆炸。

反模式是用 tournament 处理本该有客观标准的问题。能否通过测试、是否满足接口契约,不该靠品味淘汰赛。擂台适合主观或相对秩序,不适合可机器判定的对错。

范围未知就循环到停:Loop until done

有时你事先不知道工作集有多大:死代码可能还有、漏洞可能还有、间歇失败的测试可能还有。这时不该假装「跑三轮就够」,而该定义停止条件——例如连续两轮没有新发现,或某项检查连续两轮无改进——然后循环派发,直到条件满足。

循环里通常还要做去重,否则同一发现会反复出现,停止条件失真。也要防 runaway:官方 runtime 会对总 agent 数、并发数设上限,你自己设计时同样需要硬边界。Token 预算、最大轮次、最大无改进轮数,最好同时存在。

这个形状解决的是未知范围下的完备性压力。它和 fan-out 的差别是:fan-out 先有集合再穷尽;loop 边发现边扩张集合,靠停止条件宣布「暂时穷尽」。边界已经很清楚、再循环只会烧 token 的任务,不适合它。对已知 80 个文件做审查,却写成 loop until done,是典型错配。

真正值钱的是组合,不是单模式

实际高价值任务很少只落在一种形状上。更常见的是组合。

安全审计:先枚举工作集,再 fan-out 发现;对每个 finding 做 adversarial verification;最后 synthesize 成带覆盖证据的报告。没有验证,审计像惊吓清单;没有覆盖数字,审计像观点文章。

深度研究:多角度 fan-out 搜索与取证,对关键声明做交叉验证,再合成带引用结论。研究质量往往不取决于搜得有多热闹,而取决于哪些声明活过了验证。

大规模迁移:先列出调用点或文件集合,再对每个对象在隔离工作区修改;随后验证;失败则局部重试;最后汇总。隔离工作区解决并行冲突,验证解决「改了但不等价」。

分诊队列:先 classify-and-act,再对高风险动作做权限隔离。读不可信内容的角色,不直接执行高权限写操作。这是 pattern 与权限边界的组合,不只是路由技巧。

根因调查:从日志、代码、数据等不同证据面分别生成假设,再让验证者与反驳者挑战;必要时 loop,直到假设收敛,或证据不足被显式承认。它同时对抗自证和过早锁定。

命名或设计选择:先 generate-and-filter 拉开候选,再对 Top N 做 tournament。既避免单点品味,也避免全量擂台过贵。

组合时有一条实用顺序:先决定工作集如何产生,再决定是否需要验证,再决定如何聚合,最后才决定要不要循环。很多人一上来就「多开几个 Agent」,跳过了工作集和停止条件,最后得到的是热闹,不是证据。

也可以压成四问:有没有集合?集合里要不要分型?每个结果要不要独立过检?范围是否可能继续长大?四问答完,积木差不多就选好了。

跟一条完整配方:从需求到编排骨架

发版前鉴权审计配方:列出工作集、铺开审查、独立验证、合成报告,并附覆盖账本

列出工作集、铺开审查、独立验证、合成报告,并附覆盖账本

拿「发版前做一次 API 鉴权审计」当例子,走一遍公众号读者也能直接改写成提示词的骨架。

需求先写硬:检查src/routes/全部路由;只报告确认成立的问题;最终必须给出文件总数、确认数、驳回数;误报进入阻断,所以必须独立验证。

形状判断:工作集可列出 → 先枚举再 fan-out;对象同类 → 不需要先 classify;误报昂贵 → 必须接 adversarial verification;范围已知 → 不用 loop until done。

于是编排骨架就固定了:

enumerate files → fan-out audit → verify each finding → synthesize report with coverage numbers

对应提示词可以很短:

「用 workflow 审计src/routes/鉴权。先列出全部路由文件并打印数量;对每个文件做审查;每个 finding 交给独立验证者,只保留 confirmed;最终报告必须包含文件总数、发现数、确认数、驳回数和失败文件列表。」

你会发现:pattern 名称可以不出现在提示词里。真正起作用的是任务形状被翻译成了工作集、验证和覆盖证据。模型随后写脚本,多半会落到同一副骨架上。

如果把需求改成「帮我看看鉴权大概有没有风险」,形状就变了:你要的是启发,不是发版门禁。这时单上下文或单个 subagent 更合适,硬上 fan-out + verify 是烧钱。

错配比不会用更常见

不会用六种模式,最多是保守;用错模式,会主动制造成本或假信心。

把主观选择做成绝对打分,得到的是不稳定排序。把客观对错做成 tournament,浪费算力。把已知集合做成无限 loop,烧钱。把高误报场景只做 fan-out,产出惊吓清单。把异质输入直接 fan-out,专家逻辑错位。把验证者喂进发现者的长篇叙事,隔离名存实亡。

所以学 pattern,不只是记住名字,更是记住它在替你承担哪类失败,同时引入哪类成本。Fan-out 换覆盖,付并发与聚合成本;verification 换置信度,付双倍判断成本;tournament 换相对秩序,付比较次数;loop 换未知范围下的完备性,付失控风险。没有免费的形状。

怎么快速判断该用哪种

不必背模式名,按任务形状问这几句就够。

工作集能不能先列成数组?列得出,偏向 fan-out;列不出,可能要先 discover,或直接 loop until done。

对象处理逻辑是否同类?同类走 fan-out;异类先 classify。

误报是否昂贵?昂贵就加独立验证。

是在处理很多对象,还是在为同一问题找多个解?前者 fan-out,后者 generate-and-filter 或 tournament。

评价更适合绝对分,还是两两比?相对比较走 tournament。

范围是否已知?未知就给硬停止条件,不要只写「尽量完整」。

这几问答完,编排脚本的骨架基本就出来了。模型随后做的,往往是把这副骨架写成可执行代码。动态 workflow 的「动态」,很多时候不是神秘创造力,而是模型把任务几何映射到这些积木上。

如果大部分问题都答不清楚,通常不是该上更复杂 workflow,而是任务本身还没定义好。先把成功标准、边界和不可做什么写清,再谈 pattern。

什么时候不要上复杂形状

小改动、单点排查、边界清晰且人工一眼能核对的结果,用对话或单个 subagent 更快。Workflow 更贵,也会放大边界不清时的跑偏。Anthropic 也提醒过:不是每个任务都需要更多算力;五个评审团围观改按钮,通常是过度设计。

我自己用的判断很简单:要一次回答,用对话;要一套可证明、可复跑的过程,再上 workflow。选 pattern 的目标不是更炫,而是让覆盖、验证和停止条件长在结构上。

还有一个实用门槛:流程是否值得复用。一次性的好奇探索,不必沉淀成脚本;每次发版前的质量扫描、每次大迁移前的风险评估、每次技术选型前的多维研究,才值得把编排留成资产。动态生成解决的是「这次怎么组织」;保存下来解决的是「下次别从零再发明一次」。

系列收束

单上下文败在规模:它把计划、状态、证据都背在同一段对话里,规模一上就漏项、自证、漂移、被噪音淹没。

动态 workflow 把控制流、状态、覆盖交给代码:设计阶段用智能,执行阶段用结构;模型继续判断,系统开始做账。

六种 pattern 则是面对不同任务几何时的组织答案。它们可以单独用,但更常组合。稀缺的不是多开 Agent,而是让 Agent 以正确结构协作。完成靠证据,不靠语气。

顺序别反:先看任务形状,再选组织方式,最后才谈开多少 Agent。反了的话,热闹会先到,可靠性很少跟着来。

学习资源推荐

如果你想更深入地学习大模型,以下是一些非常有价值的学习资源,这些资源将帮助你从不同角度学习大模型,提升你的实践能力。

一、全套AGI大模型学习路线

AI大模型时代的学习之旅:从基础到前沿,掌握人工智能的核心技能!​

因篇幅有限,仅展示部分资料,需要点击文章最下方名片即可前往获取

二、640套AI大模型报告合集

这套包含640份报告的合集,涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师,还是对AI大模型感兴趣的爱好者,这套报告合集都将为您提供宝贵的信息和启示

​因篇幅有限,仅展示部分资料,需要点击文章最下方名片即可前往获取

三、AI大模型经典PDF籍

随着人工智能技术的飞速发展,AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型,如GPT-3、BERT、XLNet等,以其强大的语言理解和生成能力,正在改变我们对人工智能的认识。 那以下这些PDF籍就是非常不错的学习资源。

因篇幅有限,仅展示部分资料,需要点击文章最下方名片即可前往获取

四、AI大模型商业化落地方案

作为普通人,入局大模型时代需要持续学习和实践,不断提高自己的技能和认知水平,同时也需要有责任感和伦理意识,为人工智能的健康发展贡献力量。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询