☰
Paperclip“AI运营公司”本地化实测:4个Agent角色+国产模型真实跑通,三层卡点逐层击破
2026/10/8 13:03:11 网站建设 项目流程

本文实测一款开源多Agent编排平台,仅为技术验证,不构成对任何产品的购买、部署或使用推荐。

一、引子:README吹得越响,越该自己跑一次

paperclip自称“AI运营公司”,README说能一键搭出CEO、PM、Engineer、QA的Agent团队,还带预算、审批、治理。多Agent编排是热点,可全网测评大多是网页截图加功能介绍,少见有人从0部署、接国产模型、真把一条任务跑完的。

我手头正好有硅基流动的key和4.5元余额。干脆把paperclip在Windows本地从0跑一遍:部署、接入国产模型、建4角色团队、真实跑任务、测成本与审批。给数字,不给口号。

二、原理:编排层只是调度,干活的是底层Agent

大模型没有长期记忆,只在上下文窗口里临时知道东西。多Agent平台并不给模型加记忆,它做的是调度:把任务指派给某个Agent角色,Agent通过适配器调用底层CLI(opencode、ClaudeCode、Codex),CLI再带着角色prompt去调模型。

  • 编排层:公司→Agent→任务三层模型,心跳取活,角色分工;
  • 适配器:把“让一个Agent干活”翻译成“跑一条opencode命令”;
  • 底层Agent加模型:真正产出的地方。

所以选型要清醒:编排平台好部署,不等于底层工具链好接。这条认知贯穿整篇实测。

三、实验设计:五段流水线,一层一层打

样本:本地Windows、Docker已启动、硅基流动DeepSeek-V3(余额4.5元)。固定五段,每段有明确判定:

段目标判定
部署把服务跑起来端口出UI、数据库迁移成功
接入让国产模型走通onboarding能选到模型,或API绕过
建团队CEO/PM/Engineer/QA就位4个Agent可被独立唤醒
真实任务Agent真实调模型产出出现非模板的真实模型回复
成本加审批预算触顶与审批拦截行为设极小预算看是否拦、审批能否触发

其余环境全部锁死:同机、同模型、同温度默认、同一硅基账户。

四、实测结果:数字说话

1 部署:版本先坑一道

npx paperclipai@latest直接报ETARGET——它依赖的@paperclipai/server@2026.1005.0在registry里根本不存在,是上游发版错配。固定到2026.916.0绕过。

Node必须24.11以上,本机原本v22,升到24.19.0。嵌入式Postgres加278个迁移正常应用;Windows只能用run跑(service不支持),强杀会残留postmaster.pid锁文件导致重启起不来,端口还会自动切到3101,得清进程删锁再回3100。

2 接入:国产模型撞上设计性死路

onboarding的key校验硬编码请求https://api.openai.com/v1/models,源码注释明言“凭证绝不发往调用方指定的URL”(安全设计)。任何国产key在UI校验必失败,Step3还无法跳过。代理救不了——这不是网络问题,是产品把模型连接白名单写死了。

绕过方式:浏览器会话已是local operator,直接在页面里fetch('/api/…')建资源,全部201。

底层opencode更是双坑:无TTY必挂(init静默死),用WSL加script -qec给PTY后,PTY又让opencode吞掉stdin(报“You must provide a message or a command”)。最终靠三层包装:opencode-pty.cmd→WSL→ocwrapper.sh(script分配PTY,再把stdin转成消息参数),才真实产出。

3 真实任务:4个角色全部真实产出

CEO run成功,真实回复“I am the CEO agent, responsible for strategy, prioritization, and delegation…”,tokens 9816,成本$0.0025(约0.018元)。把同一任务依次指派给PM、Engineer、QA,逐个心跳唤醒,全部succeeded并各自产出真实模型回复。多角色分工机制是通的。

4 成本控制:字段能配,门禁没真拦

把Engineer预算从5元降到0.01元后触发运行——没被拦住,run照常启动;spentMonthlyCents多次运行后一直为0。更关键的是翻遍公司下14条run的resultJson.cost,全部为0——编排层根本不记每次调用的真实成本。当天在硅基流动实际产生的账单是¥0.2585(14条run加排障期数十次模型探测),这笔钱paperclip一条都没记。预算只是可配置的虚拟水位,当前版本既不记账也不强制限流。

5 审批治理:本轮没触发

UI有GOVERNANCE菜单,但服务多次运行后退化(见下),且预算受限,没在本轮实际触发一次高风险审批流。如实标注未完成。

6 可靠性:跑得越多,退化越明显

  • issue描述在run后被锁定,PATCH一律500,无法给同一任务换角色提示词;
  • issue创建随运行次数退化:服务刚起可201,跑过若干run后连无描述create也500,且不落任何日志;
  • 连续run报run terminalized on environment lease release,即run挂起超过环境租约后被强制标记为interrupted。

五、边界:别把机制当结论

这是机制性结论:证明“部署—接入—建团队—真实跑通—成本/审批”这条链在Windows加国产模型下能通,且卡点明确。不是工业级基准。单环境(Windows本地)、单模型链(DeepSeek-V3)、n=1;审批未触发不等于“没有审批”,是当前环境加预算下没跑出来。只对opencode加硅基流动这一条适配链成立,换ClaudeCode或Codex结论可能不同。成本只统计硅基实际账单,未含编排层虚拟水位。

六、横向:三层都要打通,别只信一层

  • 编排层(paperclip):部署顺、架构清晰、多角色调度是实的——这是它的价值;
  • 工具链层(opencode):无TTY挂死加PTY吞stdin两个叠加坑,Windows下尤其硬;
  • 模型层(国产):onboarding白名单写死api.openai.com,设计性堵点,需API绕过。

单Agent(直接opencode单干)vs团队(paperclip编排):单干快但无角色治理;团队有分工有预算有审批,但每条链都要你亲手打通。二者互补,不是替代。

七、小结

README吹的“AI运营公司”能落地,但顺序反了:编排层最顺、工具链层最折腾、模型层有设计性堵点。要跑通一条真实的国产模型多Agent链,三层都得打通,缺一层就是死路。你的环境、你的模型、你的任务,结论留给第一次真实运行去验证。


数据核验说明

  • 模型:deepseek-ai/DeepSeek-V3,温度默认,硅基流动端点。
  • 版本:paperclip固定2026.916.0;@latest指向的2026.1005.0在本机registry拉取时报ETARGET(上游发版错配)。
  • Node:由v22升至v24.19.0(官方zip覆盖沙箱node.exe,原文件备份)。
  • 部署形态:run --data-dir …\td,嵌入式Postgres,278个迁移,端口3100(曾因残留进程切3101后清回)。
  • 4角色run(可复现):CEOf6828961、PM13079052、Engineerbc425372、QA18be8f47,均succeeded并回传真实模型文本。
  • 成本:单次CEO run约$0.0025(约0.018元);公司下14条run的resultJson.cost全部为0,编排层不记账;当天硅基流动真实账单¥0.2585(用户提供,API余额/用量端点404/410无法独立拉取);预算字段budgetMonthlyCents设1分未拦截。
  • 可靠性:PATCH issue.description在run后500;POST issues随运行次数退化至500且无日志;environment lease release将挂起run标记为interrupted。
  • 未覆盖:审批/治理(review gate)本轮未实际触发;长任务、多Agent并行调度、预算触顶后的完整熔断流程均未测。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询