当所有人都在讨论单个AI Agent能做什么的时候,一个更根本的问题被忽略了:Agent之间怎么协作?
人类社会的生产力飞跃,从来不是因为个体变强了,而是因为协作方式升级了。从部落到城邦,从作坊到工厂,从邮件到即时通讯,每一次协作基础设施的升级都带来了数量级的效率提升。AI Agent也一样——单个Agent再强,如果不解决协作问题,就永远只能是工具,不能成为组织。
7月初,明略科技开源了Octo平台,试图为AI Agent构建一套协作基础设施。这个名字来自四个维度的首字母缩写:Open(开放)、Collaborative(协作)、Transitional(过渡性)、Organizational(组织级)。这四个词精准地描述了Octo的定位——它不是一个Agent框架,而是一套让Agent能够像组织中的员工一样协作的基础协议。
一、三个核心概念:Bot、Channel、Matter
Octo的设计哲学可以用一句话概括:让AI Agent像人一样在组织中工作。为此,Octo定义了三个核心概念。
第一个是Bot。在Octo里,每个Agent就是一个Bot。Bot有身份、有角色、有权限,也有自己的工位——它驻留在某个服务上,可以被调用,也可以主动发起协作。Bot不只是一个API端点,它是一个有完整身份标识的协作参与者。
第二个是Channel。Channel解决的是在哪协作的问题。就像企业里的微信群、钉钉群、Slack频道一样,Octo的Channel是Agent之间交换信息的空间。一个Channel可以有多个Bot参与,也可以有人类参与。Channel有类型、有权限、有历史记录。
第三个是Matter。这是Octo最有创意的设计。Matter把一次协作从聊一聊升级为交付一个成果。每个Matter都有一个明确的主题、一个参与者的列表、一系列的Thread(话题线程),以及最终的可追溯交付物。从聊天到交付,这个跃迁是Octo和普通聊天机器人的本质区别。
二、Thread:管一件事的来龙去脉
在Matter之下,Octo用Thread来管理具体的讨论和执行线索。一个Matter可以包含多个Thread,每个Thread聚焦于一个子任务或一个话题。
Thread的设计借鉴了邮件系统和论坛的精华:它有完整的上下文链条,每一个回复都能追溯到原始问题;它有状态标记,能看到哪些Thread已经解决、哪些还在进行中;它有参与者的视图过滤,每个人(或每个Bot)都能快速找到与自己相关的讨论。
对于AI Agent来说,Thread的价值尤其重大。因为Agent的上下文窗口有限,如果没有结构化的信息组织方式,Agent很快就会在大量的交互历史中迷失。Thread提供了一种自然的信息裁剪机制——Agent只需要关注当前Thread的上下文,不需要加载整个协作历史。
三、六种协作模式
Octo定义了六种Agent协作模式,覆盖了从简单到复杂的各种场景。
Solo模式:一个Agent独立完成任务,不涉及其他Agent的参与。这是最基础的模式,适合明确的、单一的任务。
Roundtable模式:多个Agent围坐圆桌,对同一个问题发表意见。每个Agent都能看到其他Agent的输出,最终由人类或者一个裁判Agent来做决策。适合方案评审、创意发散等场景。
Critic模式:一个Agent产出内容,另一个Agent专门负责挑错。这种创作者-批评者的对立结构能有效提升输出质量。适合文案撰写、代码审查、方案优化等场景。
Pipeline模式:多个Agent按照流水线的方式依次处理。第一个Agent的输出是第二个Agent的输入,依此类推。适合多步骤的串行处理流程,比如数据采集-数据分析-报告生成。
Split模式:一个大任务被拆分成多个并行的小任务,分配给不同的Agent同时处理,最后汇总。适合可以并行的批量处理场景。
Swarm模式:最复杂的模式。多个Agent像蜂群一样协作,动态分配任务、动态调整策略。适合不确定性的、需要实时协调的复杂场景。
四、四个端的覆盖
Octo目前支持四个端:Web端、移动端、浏览器插件和命令行(CLI)。这四个端覆盖了不同的使用场景。
Web端是主要的配置和管理界面,适合创建Bot、设置Channel、管理Matter。移动端适合在移动场景下查看协作状态和审批决策。浏览器插件让Octo的协作能力能嵌入到任何网页工作流中。CLI则面向开发者,适合在自动化脚本和CI/CD流程中调用。
五、Agents do, Humans decide
Octo的一个核心原则是Agents do, Humans decide——Agent负责执行,人类负责决策。这听起来像是一句漂亮的口号,但实际上它反映了对当前AI能力边界的清醒认知。
AI Agent在信息收集、数据分析、内容生成、流程执行等方面的能力已经相当强,但在承担责任、做出判断性决策方面,还远远不够。Octo的设计就是要把这两者分开:让Agent做它们擅长的事(执行),让人类做人类擅长的事(决策)。
这种设计也降低了企业采用多Agent系统的门槛。企业不需要担心AI会自作主张做出错误的业务决策。所有的关键决策点都留给了人类,AI只是提供了更充分的决策依据和更高效的执行能力。
Octo的开源意味着多AI协作不再只是大厂的专属能力。任何团队都可以基于Octo搭建自己的Agent协作网络,让多个AI像同事一样协同工作。这可能是2026年AI基础设施领域最重要的一步棋。