☰
DeepOpen三大决策原语完全指南:choice、score、noul如何覆盖企业90%的AI决策场景
2026/9/27 11:18:04 网站建设 项目流程

DeepOpen三大决策原语完全指南:choice、score、noul如何覆盖企业90%的AI决策场景

【免费下载链接】deepopen非自回归System 1决策引擎,专为结构化类型决策场景设计 DeepOpen Multilingual, non-autoregressive System 1 decision engine.项目地址: https://gitcode.com/gh_mirrors/de/deepopen

DeepOpen 是一款开源的多语言、非自回归 System 1 决策引擎,它不逐 Token 生成文本,而是在单次前向传播中直接输出结构化决策结果。其核心是三大决策原语——choice(选择题)、score(评分题)、noul(判断题),三者组合即可覆盖意图识别、工单分诊、风险预警等绝大多数企业 AI 决策场景,单题延迟低至 33 毫秒,且置信度经过严格校准,可直接驱动自动审批流。

为什么大模型不擅长"做决定"?

用大语言模型(LLM)判断"这条邮件该转给哪个部门",看似简单,实际有三大痛点:

  • ⏱️慢:逐 Token 生成,单次响应动辄数百毫秒到数秒;
  • 🎲幻觉:输出自由文本,可能答出你从未定义过的类别,还要写解析器兜底;
  • 💸贵:按 Token 计费,百万次判断的成本远超自建 GPU。

DeepOpen 的思路是不生成文本,只输出决策:所有答案都是开发者预先定义的结构化类型,从根源上杜绝幻觉,无需解析,输出即结果。

三大决策原语:三种题型,一个模型

DeepOpen 把企业决策抽象成三种"题型",定义在 deepopen/agent.py 的system_one推理方法中,类型映射见 deepopen/common.py 的QTYPES。

1️⃣ choice:单选题——"属于哪一类?"

输出:最优标签 + 每个选项的概率 + 置信度。

典型场景:意图分类、部门路由、主题归类、邮件分流。

"department": { "type": "choice", "instructions": "Which department should handle this request?", "criteria": { "billing": "invoices, payments, refunds", "technical": "bugs, outages, system errors", "sales": "pricing, new contracts", "other": "everything else" } }

模型返回类似billing (confidence: 0.94),同时给出各选项概率分布,方便你按阈值做人工兜底。

2️⃣ score:评分题——"程度有多高?"

输出:有序量表上的期望得分 + 各等级概率分布 + 置信度。

典型场景:工单紧急度、用户挫败感、危害严重度、任务难度分级。

"urgency": { "type": "score", "instructions": "How urgent is this request?", "criteria": ["not urgent", "soon", "critical deadline or blocking issue"] }

例如返回score: 1.84 / 2.0,比单纯输出"高/中/低"更细腻,可精确驱动 SLA 分级。

3️⃣ noul:判断题——"是还是否?"

输出:0.0–1.0 之间校准后的 P(为真) 概率。

典型场景:钓鱼邮件检测、垃圾过滤、越狱识别、流失风险、退款请求。

"churn_risk": { "type": "noul", "instructions": "Does the user threaten to cancel or leave?" }

返回noul: 0.892,表示 89.2% 的概率该用户在威胁取消——这是可直接用于风控门控的统计概率,而非拍脑袋的分类。

💡 三者本质是同一模型在不同"题型头"下的输出:choice 取 argmax,score 算期望值,noul 取二项概率。一个请求可以同时混合三种题型,一次前向传播全部答完。

三大原语组合:一次调用完成完整分诊

企业场景很少只问一个问题。DeepOpen 允许在一次predict调用中混排多道题:

questions = { "department": {"type": "choice", ...}, # 转给哪个部门? "urgency": {"type": "score", ...}, # 多紧急? "churn_risk": {"type": "noul", ...}, # 会不会流失? "refund_requested":{"type": "noul", ...} # 是否要求退款? } res = router.predict(state, questions)

四个问题,一次前向传播,T4 显卡上约 33 毫秒。这正是三大原语能覆盖"90% 场景"的原因——分类、排序、预警,一个模型全接管。

开箱即用的预设工作流

项目内置了 deepopen/presets.py,提供四类调优好的问题模板,无需从零写规则:

预设核心问题涉及原语
客服工单分诊triage_questions()意图、紧急度、挫败感、退款、流失风险全部三种
邮件分流email_questions()部门、垃圾、钓鱼、紧急度、是否需回复全部三种
Prompt 防护guard_questions()越狱、注入、敏感数据、危害等级、话题全部三种
内容审核moderation_questions()毒性、骚扰、威胁、垃圾、严重度全部三种
模型路由router_questions()难度、领域、是否需要工具、是否敏感全部三种

例如智能模型路由:用score判断请求难度、choice判断领域、noul判断是否涉钱涉法——简单请求路由到小模型省钱,敏感请求直接拦截。

多语言不是口号:Router 自动调度

DeepOpen 提供三个检查点(英文 / 多语言 / 类型决策微调版),内置智能路由器 deepopen/router.py 在<0.5 毫秒内识别脚本与语言,自动调度最优模型:

  • 英文输入 → 英文检查点(XNLI 准确率 0.860)
  • 其他 100+ 语言 → 多语言检查点(mmBERT,速度快 2 倍)
  • 结构化决策工作流 → 可显式指定model="typed-decisions"

一个真实教训:纯英文检查点遇到高棉语时准确率为 0.000,却报出 95.2% 的错误置信度——靠置信度阈值根本拦不住,所以路由判断必须发生在前向传播之前,这也正是 Router 存在的原因。

实测成绩:两个公开榜单双双上榜

在 CLINC150(150 类意图)和 Banking77(77 类意图)两个公开基准上,DeepOpen 分别取得98.0222%(第 2 位)和94.0909%(第 5 位),完整打榜对照见上方图片,数据明细分别记录在 clinc150/RESULTS.md 与 banking77/RESULTS.md。

与主流决策引擎的硬碰硬对比

在 17,416 道题的共享基准上(同一 T4 显卡、逐字节相同的题目),DeepOpen 路由模式的表现:

维度DeepOpen(路由模式)TypeSafe Jev 1.13.0
类型决策准确率(2000 样本)0.7660.727
预期校准误差 ECE0.0810.144
P50 单题延迟32.8 ms236–276 ms
可用语言(>3×随机基线)51 种中 45 种无公开多语言基准
部署模式完全自托管开源仅封闭 API
推理成本$0$0.042 / 百万 Token

完整数据见 BENCHMARKS.md 与 research/results/。

置信度门控:让 AI 自己知道"什么时候该找人工"

由于采用严格正确评分规则(RLCD)训练并做域温度校准,DeepOpen 输出的概率具有真实统计意义(ECE 低至 0.081)。生产环境典型玩法:

if conf >= 0.85: route_automatically(dept) # 高置信:自动处理 else: escalate_to_human(dept, conf) # 低置信:转人工

50% 流量自动化的前提下仍保持 92.2% 准确率——这是"选择性自动化"能落地的关键。

快速上手:三步接入

pip install deepopen
from deepopen import Router router = Router(preload=True, device="cuda") # 预加载,亚35ms路由 res = router.predict(state, questions) # 一次调用,多题并答 print(res["answers"]["department"]["choice"]) # -> billing (0.94)

生产环境可只预加载所需检查点(router.preload(["english", "multilingual"]))或用 LRU 策略(Router(max_loaded=2))控制显存。若已有业务数据,还可用 notebooks/laya_finetune_typed_decisions_2xT4_kaggle.ipynb 在 Kaggle 免费 2×T4 上 4–5 小时完成领域微调,将基线准确率从 0.36 提升到 0.766。

总结:用三种题型装下 90% 的决策需求

你的需求选哪个原语一句话输出
属于哪一类choice最优标签 + 概率
程度多高score0 到 N 的期望分
是否发生noul校准概率 0–1

DeepOpen 的价值不在于"又一个模型",而在于把企业 AI 决策收敛为三种可组合的题型:不生成文本、零幻觉、33 毫秒出结果、置信度可门控、自托管零推理成本。如果你的场景是分类、排序、预警,这三种题型大概率已经够用。

【免费下载链接】deepopen非自回归System 1决策引擎,专为结构化类型决策场景设计 DeepOpen Multilingual, non-autoregressive System 1 decision engine.项目地址: https://gitcode.com/gh_mirrors/de/deepopen

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询