Ollama 0.35 把决策模型塞进本地:91ms、零 API 成本,AI 决策不再交延迟税
先说结论:这不是一次普通更新。Ollama 0.35 把 Jev 风格的决策模型带到了本地,三个模型、一个新 API、单次决策低于 100ms,而且不用花一分钱 API 费用。
这不是小打小闹,这是 AI 决策层的一次路线切换。
大部分 AI 决策,根本不需要“写作文”
很多系统里的 AI 决策,并不需要 700 亿参数模型给你写一段解释。它只需要一个快速、带类型、代码能直接用的答案。
比如客服工单进来,系统要知道三件事:
- 这是账单问题还是技术问题?
- 需不需要升级处理?
- 紧急程度有多高?
前沿大模型当然能回答。但代价是:每次工单都要花钱,延迟可能 2 秒,返回的还是一段自由文本。你的代码接下来还得解析、校验,模型一旦想“解释一下”,你还得重试。
Ollama 这次问了一个很简单的问题:我们为什么不换个做法?
Ollama 0.35 到底发了什么
2026 年 9 月 29 日,Ollama 发布 0.35 版本,通过新的/v1/systemone端点支持 Jev 风格决策模型,底层基于 TypeSafe 的 Jev API。
它不是让你发 prompt 等生成,而是让你发一个状态对象和一组命名问题,模型在单次请求里返回带类型的答案。
首日上线三个模型:
- Nimble:Bespoke Labs 开源的 9B 决策模型,也是这次的主力。在 M5 Max 本地跑,平均每次决策 91ms。
- tev1:Together AI 的 4B 实验模型,从 Qwen3.5 微调而来。
- tev1:0.8b:0.8B 参数的最小版本,面向边缘部署和极低算力环境。
三个模型除了主决策结果,还会返回概率和置信度。你的应用能直接看到模型有多确定。不用解析,不用校验 schema,也不会冒出幻觉标签。
API 支持三种问题类型:
- Choice:从你定义的条件映射里选一个选项。
- Noul:其实就是 Bernoulli,对一个是非陈述返回 0 到 1 之间的概率。
- Score:把状态放到一个 2 到 10 级的有序评分标准上。
多个问题可以针对同一个状态并行评估。问五个问题和问一个问题,耗时差不多。
为什么本地跑会改变账本
最抓眼球的数字是 91ms。但更重要的数字,是延迟图上根本不会出现的那个:零网络跳转。
你走托管 API 跑决策模型,每个请求都要过互联网。第三方基准里,TypeSafe 托管版 Jev API 端到端要 236 到 276ms,这里面还包括网络时间。
在本地 RTX 5060 Ti 上,独立测试 Ollama 决策方案,多个模型的中位延迟在 33ms 到 73ms 之间。有意思的是,最准的那个模型反而最快。
这是 3 到 8 倍的往返时间差距,还没算 API 成本。
成本方面:Jev 收费是每百万输入 token 0.042 美元,输出不收费。Ollama 本地跑,成本直接是零。
一个每月处理 4 万张客服工单的创业公司,前沿大模型按 OpenRouter 基准大概每月 115 美元,本地决策模型是 0 美元。这不是小幅优化,这是结构性的差别。
而且本地跑还顺手解决了数据治理问题。客户数据不用发给第三方 API,合规和隐私团队会轻松很多。
实际跑起来是什么样
举个具体例子。
一张账单工单进来,内容是:“我被扣了两次费,请把多扣的钱退回来。”
你把它发给本地 Ollama 端点,带三个问题:
- Team:在 billing、technical、other 之间选一个
- Refund:Noul 问题,客户是不是明确要求退款?
- Urgency:从 routine 到 urgent 的评分
91ms 后返回。模型说 billing 概率 98.5%,退款概率 99.7%,紧急度评分 0.815。你的代码直接读字段,该路由路由,该升级升级。没有解析,没有重试,也不会遇到“我不能帮你处理这个”的边界情况。
Ollama 博客里还放了一个 Pac-Man 例子,同样的模式用在实时决策上。一个 9B 模型做出低于 100ms 的决策,快到能玩游戏。这不是跑分,这是给所有需要机器速度做有界判断的实时系统做的概念验证。
GitHub 上的 JevShield 项目也展示了安全方向的实现:用 Ollama 决策 API 评估多个安全维度,返回结构化结果,用于提示注入检测和工具调用安全判断。
别光看好处,这些坑得说清楚
只讲优点不厚道。限制是真实存在的。
- 不生成文本。决策模型不写东西。它们做分类、路由、评分、判断。你需要回复文案,还是得在链路里放一个生成模型。比较顺的模式是:Jev 风格模型做决策,LLM 写回复。
- 只吃文本。图片、音频、PDF 都不能作为输入。状态必须是字符串、字符串数组,或者键值对。
- 算术和日期是弱项。TypeSafe 自己的文档也提醒,数字、日期比较、对抗性内容上并不可靠。
- 上下文有限。Jev API 大约支持 32,000 token 的状态加最长问题,所有问题共享 64,000 token 预算。
- 选项顺序敏感。独立基准显示,重新排列选项可能改变答案。Jev 处理得不错,翻转率 0 到 1.9%,但有些本地模型更容易受影响。
这些限制不是否定它,而是划出边界。知道边界,才知道该把它放在技术栈的哪一层。
跟其他方案比,谁强谁弱
TypeSafe 托管版 Jev 仍然是质量基准。独立测试跑了 770 个 Reddit AITA 判决和多个分类数据集,Jev 在 49 个任务里的 42 个上匹配或超过 LLM 基线,延迟大约只有七分之一,成本大约只有四分之一。
但开源生态跑得很快。
Laya,421M 参数,基于 ModernBERT。GPU 上 33ms,但选项顺序一变,翻转率最高到 23%。超过 20 个选项还会退化,非拉丁文字会静默失败。
Verdict走了另一条路。118M 参数,CPU 上批量跑可以做到亚毫秒级。校准非常强:ECE 在 0.014 到 0.030,Jev 是 0.144 到 0.246。它还支持 conformal abstention,也就是能带覆盖保证地说“我不知道”。但零样本准确率在 Banking77 上只有 0.594,Jev 是 0.80 到 0.87。
NeoHorse-Jev-4B,Apache 2.0 协议。在语音路由上和 Jev 统计打平,在中文测试的两个业务任务上还超过 Jev,但在紧急度评分和诈骗检测上落后。
传统方案也值得提一句。正则表达式便宜但脆,prompt 分类器灵活但慢且要解析,前沿大模型准但贵。Jev 风格决策模型卡在中间:比正则聪明,比大模型快,比托管 API 便宜,输出还直接能编程用。
结论是:Jev 风格决策模型不是互相替代的。你要准就选 Jev,要校准就选 Verdict,要多语言就看 Laya,要做中文业务任务可以看 NeoHorse。关键是想清楚你优化的是什么。
这东西适合谁
如果你在做高并发、有边界的决策系统,这次更新和你有关。
- AI Agent 开发者:在模型之间路由、检查工具调用安全、管理升级逻辑。每一次托管 API 往返,都是用户能感觉到的延迟成本。
- 客服平台:每天分拣成千上万张工单。每月 115 美元和 0 美元的差别,不是四舍五入的误差。
- 内容审核团队:大规模分类和标记。带概率分数的类型化决策,在每一个重要维度上都比正则和 prompt 分类器强。
- 在 Ollama 上做产品的创业公司:想要决策层能力,又不想多一个 API 依赖、多一个账单关系、多一个故障点。
- 隐私敏感行业和本地部署场景:数据不出内网,决策还在毫秒级完成。
目标市场也很清楚:客服、Agent 基础设施、内容安全、边缘计算,以及任何需要把“判断”做成基础设施而不是做成聊天窗口的产品。
总结
Ollama 这次发的不是功能,是信号。
2024 和 2025 年,AI 行业一直在追更大的模型、更长的上下文。话题围绕生成:写文章、做推理、给解释。
Jev 风格决策模型反过来。它们说:你技术栈里最有价值的 AI,可能什么都不生成。它只告诉你的代码下一步做什么,毫秒级,带一个你真能信的概率。
Ollama 这一步,让这种能力可以免费跑、随便迭代、任意规模部署。本地优先的架构还顺手干掉了把客户数据发给第三方 API 带来的治理问题。
模型很小。API 很简单。延迟几乎可以忽略。
有时候最重要的发布,就是让其他所有东西变得更便宜、更快。