做很多的插件,不等于每一个插件都被很多人用。如果合理地去规划插件开发的范式,能够实现有很多插件,且每一个插件都被人高频使用。这里我想提出一个核心观点:插件与插件其实应该是互相连接的。
设计是一个迭代的过程,插件化要匹配真实的工作与交互需求。从我自2011年开始开发机器人,从早期的框架项目、零散插件,一路走到如今自研的统一机器人指令系统,我得出的最大经验就是:孤立的功能插件很难被用户持续使用。只有能融入完整使用链路、和其他功能形成联动的插件,才能保持稳定的生命力。
观察现在的AI智能体生态,无论是各种Skill市场还是基于Harness的插件系统,绝大多数都还停留在“一个Skill解决一个具体工作”的阶段。它们就像是一把把孤立的扳手,工具调用链非常单一。目前的智能体还没有真正进入到一个搭载多种工具、去满足大量人复杂协同需求的场景。虽然偶尔能看到AI按顺序调用几个工具来获取答案,但这依然停留在工程化的“工具堆砌”层面。
我们在做的事情,维度和传统的工具类插件完全不同。在一念成仙的底层架构中,我们虽然同样基于Chatbot、基于大语言模型、基于RAG和各种上下文插件,但我们并不是在做工程工具,而是在用纯文本和严苛的模块设计,去抽象一个鲜活的虚拟社交世界。
在这个架构里,插件的意义被彻底重构了。比如某个插件的职责,是处理一个用户带着他的上下文在这个虚拟地图上进行移动。传统带有客户端的游戏,解决这个问题靠的是庞大的3D渲染引擎;而我们背后的驱动力是一个Bot架构。无论是信息总线的流转,还是用户个人数据的隔离与储存,都与传统引擎有着天壤之别。
这就要求我们的插件系统必须做到深度的互相连接。怎么连接?靠的是极其严格的程序约束和统一的签名规范。在这个抽象层之上,每一个插件都必须遵循相同的数据状态流转规则。通过严格控制底层的数据访问逻辑和内存边界,我们让AI在这个文字世界里的每一步操作都合乎逻辑。就像搭积木或者Minecraft一样,当你铺好了平整的土地,你就会想建房子;有了房子,你会想要水流,想要日夜交替。我们通过统一的规范,把这些抽象的社交场景紧密咬合在一起,比如从地图移动无缝衔接到拜访好友的仙居,再到触发复杂的社交互动,最后将状态稳妥地记录到底层的师徒关系表里。
很多时候,人们会问我们是不是在造一个游戏。其实不是。我们做的是一个基于AI的社交娱乐QQ机器人系统,我们真正在做的,是设计严密的Harness去约束AI。如果放任不管,AI可能会让用户在移动时直接飞出地图边界,或者给出破坏世界观的意外回应。我们不改变传统意义上的引擎状态,我们改变的是用户在当前交互链路中的上下文状态。这也是为什么,我们认为把强大的AI仅仅用来做一问一答的对话闲聊,简直是牛刀小用。
顺着这种深度耦合的插件生态,我们可以脑洞大开地往未来看一步。如果在我们的文字世界里,AI的能力不仅仅是返回文本,而是能实时生成一个三维甚至四维的空间呢?
由于我们的底层架构摒弃了传统3D视觉引擎的束缚,完全以文本和提示词作为核心运转,这意味着我们掌握着这世界上熵最高的信息源头。文字给予了用户最大的想象留白,每一个修仙者脑海中的世界都是独一无二的。而一旦未来的算力迎来真正的爆炸式跃升,能够以极低的成本实时将这些高熵的文本流转化为视频或空间,我们的应用就能瞬间完成降维打击般的“升维”转换。到那时,一念成仙就不再仅仅是一个文字Chatbot,而是一个真正可组织、可参与的鲜活世界。这比那些炒作概念的元宇宙要扎实得多。
我们甚至不计成本地做过一次极其小范围的前沿测试。我们对接了业界顶级的视频生成大模型,将我们用户在文字世界里的一段简单操作链——从地图移动,到进入他人仙居拜访,两人对坐长谈,最终结为师徒并点亮头衔——实时输入给模型进行生成。
结果是我们得到了一部极具修仙风格、长达20分钟的动画。效果远比我们一年前尝试用AI生成静态切片图时要惊艳得多,剧情和画面的连贯性令人震撼。
但随之而来的是残酷的商业现实。这20分钟的视频,每一分钟的生成成本高达150块钱。在这个极其简单的两人社交交互上,我们烧掉了3000块钱,并且足足等待了7天的生成时间。在现阶段的算力和时间、空间成本下,这种模式显然是不具备商业可行性的。这也是为什么我们依然坚定地深耕纯文本系统,拒绝为了盲目追逐视觉噱头而推高系统成本,最终导致业务无法持续。
但这3000块钱的测试,彻底坚定了我们对架构路线的信心。它证明了只要底层是由无数个严密耦合、互相连接的插件构筑的坚实基座,一旦未来迎来了类似当年256K内存跨越到128G那样的算力奇点,我们的文字抽象层就能以秒级、低成本的方式直接绽放成一个真实的视觉世界。
插件永远不该是孤立的堆砌,当我们将它们巧妙地编织在一起,它所能承载的,将是一个拥有无限可能的未来生态。