做过 Agent 的都有体会:Agent 干活的本质是一个循环:LLM 决策、工具执行、模型评估、再继续,直到任务完成。问题是,这个循环里每一次「决策」都要完整调一次大模型,又慢又贵。
LangChain 官方博客刚发了一篇文章,介绍了一个新解法:把循环里「做判断」的环节拆出来,交给一个专门做结构化决策的模型 Jev。官方报告的数据相当夸张:分类任务上推理速度快 200 倍,成本只有同等 LLM 的 1/400。
这篇我把原文编译 + 拆解给你:Jev 到底是什么、三种提问方式怎么用、怎么接进 LangChain,以及两个最值得抄的落地场景。文中的 JSON 和 Python 代码都可以直接抄走改。
1.打开 AITutor 新一代 AI 原生学习伙伴:www.aiaitutor.com 2.在首页输入"Jev” 就能看到更详细更丰富案例。 3.包含了图文、视频、播客、闪卡、代码、测验等9种学习模态。一、先把问题说准:Agent 循环慢在哪、贵在哪
Agent 和 LLM 刚出来的时候,很难接进软件系统,因为软件要的是结构化数据和可预测的接口。后来两个原语解决了这个问题:
- Tool calling:让模型发出结构化请求、拿到结构化结果;
- Structured outputs:让模型返回结构化结果。
但就算这两个都有了,Agent 循环依然又慢又贵,原因很简单:每一次决策,都要再调一次完整的聊天大模型。路由一下请求要调一次,判断一个工具调用危不危险要调一次,每一步都在烧 token、烧延迟。
一句话:LLM 是个全才,但你让它干的很多活,其实只是「做个判断」。让一个全才反复做判断题,就是现状里最大的浪费。
二、Jev 是什么:不生成文字的「System One」模型
先说清楚,Jev 不是传统意义上的 LLM,它根本不生成文字。TypeSafe AI 团队把它叫做 System One 模型:
📖 System One 模型是一类专为「快速、结构化、软件可直接消费的判断」而生的 AI 模型。它评估一个状态(state),返回带类型的答案和概率。
它的训练方式也不一样,用的是 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习)。你的代码拿到这些概率结果,直接决定 Agent 下一步怎么走,全程不需要为每个决策调一次完整的聊天 LLM。
调用方式也很直接:给它一个状态(上下文),再给它一组关于这个状态的问题。看官方文档里客服工单的例子:
{ "model": "jev-latest", "state": "Hi, I've been trying to connect my Stripe account for 3 days and it keeps failing. I'm losing sales. Please help ASAP.", "questions": { "is_urgent": { "type": "noul", "instructions": "The message conveys urgency or time-sensitivity" } } }返回结果长这样:
{ "is_urgent": { "type": "noul", "noul": 0.999 } }99.9% 的概率是紧急工单,你的应用拿这个数直接做优先级排序就行。没有废话,没有寒暄,没有多余的 token。
三、三种问题类型:Choice、Score、Noul
Jev 一共支持三种提问方式,覆盖大部分「判断」场景:
| 问题类型 | 干什么用 | 返回什么 |
|---|---|---|
| Choice | 从一组选项里挑一个,比如「这个工单该分给哪个团队」 | 每个选项的概率 + 整体置信度 |
| Score | 把输入放到有序等级上评估,比如「客户有多恼火:平静 / 恼火 / 暴怒」 | 连续分数 + 底层分布 + 置信度 |
| Noul | 回答一个是非题,比如「这条消息是否紧急」 | 该陈述为真的概率 |
注意每种类型都带置信度。这意味着你的代码可以设定阈值策略:置信度高的自动放行,置信度低的转给大模型或者人工。工程上这一点非常关键,判断题最怕的就是「模型瞎蒙还特自信」,校准过的概率就是干这个的。
四、一次请求,并行问多个问题
这是 Jev 一个很妙的设计:同一次请求里可以问多个问题,而且是并行评估的。
💡 System One 模型会并行评估一次请求中的所有问题。加问题几乎不影响响应时间,成本也只增加那几个问题本身的 token,非常便宜。
对比一下传统做法:用 LLM 同时判断「紧不紧急、分给谁、客户情绪如何」,要么调三次,要么在一个 prompt 里塞三个任务再费劲解析输出。Jev 这边就是一次请求、三个字段、三份概率,干净利落。
一句话:LLM 是顺序生成文字的,天生串行;Jev 不生成文字,天然并行。这就是结构性优势。
五、接入 LangChain:一个 TypeSafeClassifier 搞定
LangChain 的提供商无关架构接 Jev 很自然,集成暴露出来的接口是 TypeSafeClassifier:把状态和问题传给 .invoke(),拿到的是分类结果而不是聊天回复。
装包、设好 TYPESAFE_API_KEY,然后这样调:
from langchain_typesafe import Noul, TypeSafeClassifier classifier = TypeSafeClassifier() response = classifier.invoke({ "state": ( "The deploy failed twice and customers are seeing 500s. " "Can someone look now?" ), "questions": { "urgent": Noul( instructions="Does this need attention right now?" ), }, }) urgency = response.nouls["urgent"].noulstate 可以是文本、结构化数据,也可以是 LangChain 的 messages。也就是说,在 Agent 的节点或 middleware 钩子里面,直接用现有的上下文就能调 Jev,然后把它包进自定义 middleware 或工具里。
六、两个最值得抄的落地场景
先划个边界:Jev 不是 LLM 的平替,它不生成文字。它的正确定位是做 LLM 的搭档:开放式推理和生成交给 LLM,沿途的快速结构化判断交给 Jev。在这个定位下,原文给了两个场景,都很实用。
场景 1:模型路由
简单查询和复杂调试不该用同一个模型。模型路由 middleware 让 Jev 先评估请求,再按你定的标准选模型:简单的活走便宜快速的模型,复杂的活才上更强的模型:
from langchain.agents import create_agent from langchain_typesafe.experimental.middleware import ( ModelChoice, ModelRouterMiddleware, ) router = ModelRouterMiddleware( choices={ "fast": ModelChoice( model="openai:luna", criteria="Direct lookups, extraction, and localized changes.", ), "powerful": ModelChoice( model="openai:sol", criteria="Architecture and high-stakes decisions.", ), }, instructions="Choose the least costly model that can complete the task.", ) agent = create_agent("openai:gpt-5.6-luna", middleware=[router])路由器从最新一条用户消息里选出模型,整个 run 都用它。选模型的概率和置信度也会留在 agent state 里,随时可以查。
场景 2:Auto Mode,给危险操作装上「刹车」
Agent 本质上是不可信的:它可能收到坏指令(无意的,或者攻击者刻意注入的),被诱导执行你不想要的操作。
Claude Code、Codex、Cursor 这些 coding harness 都内置了某种「危险动作分类器」,在工具执行前先拦一道,正是这个东西慢慢建立起了大家对 Agent 的信任。但到现在为止,这个分类器一直锁在各家闭源的 harness 内部,你自己做的 Agent 用不了。
现在有了便宜又快的分类器模型,这个模式可以普及到所有 Agent 了:
from langchain.agents import create_agent from langchain_typesafe.experimental.middleware import ( AutoModeMiddleware, ) guardrail = AutoModeMiddleware(tools=["bash"]) agent = create_agent("openai:gpt-5.6-luna", middleware=[guardrail])AutoModeMiddleware 用 Jev 检查工具调用里的风险决策,在工具真正执行之前就把危险调用拦下来。
题眼在这里:以前「权限弹窗」和「危险拦截」是大厂 harness 的专属能力,现在一个开源 middleware 加一个小模型就搞定了。自己搓 Agent 的同学,这条直接抄。
七、它不是什么:别拿 Jev 当 LLM 用
最后泼点冷水,防止有人上头。Jev 和 LLM 的分工边界很清晰:
| LLM | Jev | |
|---|---|---|
| 输出 | 自由文本 | 类型化答案 + 概率 |
| 决策方式 | 顺序生成 | 并行评估 |
| 适合 | 开放式推理、生成、对话 | 路由、拦截、打分、是非判断 |
| 成本/延迟 | 高 | 官方报告:快 200 倍、便宜 400 倍 |
生态里已经有人在用了:Browserbase 的 Kyle Jeong 拿它驱动浏览器 Agent,一次调用成本不到一分钱;Jarrod Watts 做了个实时交易 Agent;Ryan Vogel 在用它做大规模邮件分诊。
八、结语
每周都有新模型发布,但 Jev 这次的反响明显大一圈,我觉得原因是它指了一个方向:Agent 系统的下一步进化,不是换一个更大的模型,而是把系统拆得更细。
慢思考的大模型负责推理和创造,快思考的小模型负责判断和把关,这其实就是「System Two + System One」那套双系统理论在 Agent 工程里的落地。你的 Agent 循环里每一个「调大模型做判断」的地方,都是潜在的优化点。
与其等下一个更强的模型来拯救你的 Agent 延迟和账单,不如这个周末就把循环里的判断题抽出来,让专门的模型去答。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~