DeepOpen三大决策原语完全指南:choice、score、noul如何覆盖企业90%的AI决策场景
【免费下载链接】deepopen非自回归System 1决策引擎,专为结构化类型决策场景设计 DeepOpen Multilingual, non-autoregressive System 1 decision engine.项目地址: https://gitcode.com/gh_mirrors/de/deepopen
DeepOpen 是一款开源的多语言、非自回归 System 1 决策引擎,它不逐 Token 生成文本,而是在单次前向传播中直接输出结构化决策结果。其核心是三大决策原语——choice(选择题)、score(评分题)、noul(判断题),三者组合即可覆盖意图识别、工单分诊、风险预警等绝大多数企业 AI 决策场景,单题延迟低至 33 毫秒,且置信度经过严格校准,可直接驱动自动审批流。
为什么大模型不擅长"做决定"?
用大语言模型(LLM)判断"这条邮件该转给哪个部门",看似简单,实际有三大痛点:
- ⏱️慢:逐 Token 生成,单次响应动辄数百毫秒到数秒;
- 🎲幻觉:输出自由文本,可能答出你从未定义过的类别,还要写解析器兜底;
- 💸贵:按 Token 计费,百万次判断的成本远超自建 GPU。
DeepOpen 的思路是不生成文本,只输出决策:所有答案都是开发者预先定义的结构化类型,从根源上杜绝幻觉,无需解析,输出即结果。
三大决策原语:三种题型,一个模型
DeepOpen 把企业决策抽象成三种"题型",定义在 deepopen/agent.py 的system_one推理方法中,类型映射见 deepopen/common.py 的QTYPES。
1️⃣ choice:单选题——"属于哪一类?"
输出:最优标签 + 每个选项的概率 + 置信度。
典型场景:意图分类、部门路由、主题归类、邮件分流。
"department": { "type": "choice", "instructions": "Which department should handle this request?", "criteria": { "billing": "invoices, payments, refunds", "technical": "bugs, outages, system errors", "sales": "pricing, new contracts", "other": "everything else" } }模型返回类似billing (confidence: 0.94),同时给出各选项概率分布,方便你按阈值做人工兜底。
2️⃣ score:评分题——"程度有多高?"
输出:有序量表上的期望得分 + 各等级概率分布 + 置信度。
典型场景:工单紧急度、用户挫败感、危害严重度、任务难度分级。
"urgency": { "type": "score", "instructions": "How urgent is this request?", "criteria": ["not urgent", "soon", "critical deadline or blocking issue"] }例如返回score: 1.84 / 2.0,比单纯输出"高/中/低"更细腻,可精确驱动 SLA 分级。
3️⃣ noul:判断题——"是还是否?"
输出:0.0–1.0 之间校准后的 P(为真) 概率。
典型场景:钓鱼邮件检测、垃圾过滤、越狱识别、流失风险、退款请求。
"churn_risk": { "type": "noul", "instructions": "Does the user threaten to cancel or leave?" }返回noul: 0.892,表示 89.2% 的概率该用户在威胁取消——这是可直接用于风控门控的统计概率,而非拍脑袋的分类。
💡 三者本质是同一模型在不同"题型头"下的输出:choice 取 argmax,score 算期望值,noul 取二项概率。一个请求可以同时混合三种题型,一次前向传播全部答完。
三大原语组合:一次调用完成完整分诊
企业场景很少只问一个问题。DeepOpen 允许在一次predict调用中混排多道题:
questions = { "department": {"type": "choice", ...}, # 转给哪个部门? "urgency": {"type": "score", ...}, # 多紧急? "churn_risk": {"type": "noul", ...}, # 会不会流失? "refund_requested":{"type": "noul", ...} # 是否要求退款? } res = router.predict(state, questions)四个问题,一次前向传播,T4 显卡上约 33 毫秒。这正是三大原语能覆盖"90% 场景"的原因——分类、排序、预警,一个模型全接管。
开箱即用的预设工作流
项目内置了 deepopen/presets.py,提供四类调优好的问题模板,无需从零写规则:
| 预设 | 核心问题 | 涉及原语 |
|---|---|---|
客服工单分诊triage_questions() | 意图、紧急度、挫败感、退款、流失风险 | 全部三种 |
邮件分流email_questions() | 部门、垃圾、钓鱼、紧急度、是否需回复 | 全部三种 |
Prompt 防护guard_questions() | 越狱、注入、敏感数据、危害等级、话题 | 全部三种 |
内容审核moderation_questions() | 毒性、骚扰、威胁、垃圾、严重度 | 全部三种 |
模型路由router_questions() | 难度、领域、是否需要工具、是否敏感 | 全部三种 |
例如智能模型路由:用score判断请求难度、choice判断领域、noul判断是否涉钱涉法——简单请求路由到小模型省钱,敏感请求直接拦截。
多语言不是口号:Router 自动调度
DeepOpen 提供三个检查点(英文 / 多语言 / 类型决策微调版),内置智能路由器 deepopen/router.py 在<0.5 毫秒内识别脚本与语言,自动调度最优模型:
- 英文输入 → 英文检查点(XNLI 准确率 0.860)
- 其他 100+ 语言 → 多语言检查点(mmBERT,速度快 2 倍)
- 结构化决策工作流 → 可显式指定
model="typed-decisions"
一个真实教训:纯英文检查点遇到高棉语时准确率为 0.000,却报出 95.2% 的错误置信度——靠置信度阈值根本拦不住,所以路由判断必须发生在前向传播之前,这也正是 Router 存在的原因。
实测成绩:两个公开榜单双双上榜
在 CLINC150(150 类意图)和 Banking77(77 类意图)两个公开基准上,DeepOpen 分别取得98.0222%(第 2 位)和94.0909%(第 5 位),完整打榜对照见上方图片,数据明细分别记录在 clinc150/RESULTS.md 与 banking77/RESULTS.md。
与主流决策引擎的硬碰硬对比
在 17,416 道题的共享基准上(同一 T4 显卡、逐字节相同的题目),DeepOpen 路由模式的表现:
| 维度 | DeepOpen(路由模式) | TypeSafe Jev 1.13.0 |
|---|---|---|
| 类型决策准确率(2000 样本) | 0.766 | 0.727 |
| 预期校准误差 ECE | 0.081 | 0.144 |
| P50 单题延迟 | 32.8 ms | 236–276 ms |
| 可用语言(>3×随机基线) | 51 种中 45 种 | 无公开多语言基准 |
| 部署模式 | 完全自托管开源 | 仅封闭 API |
| 推理成本 | $0 | $0.042 / 百万 Token |
完整数据见 BENCHMARKS.md 与 research/results/。
置信度门控:让 AI 自己知道"什么时候该找人工"
由于采用严格正确评分规则(RLCD)训练并做域温度校准,DeepOpen 输出的概率具有真实统计意义(ECE 低至 0.081)。生产环境典型玩法:
if conf >= 0.85: route_automatically(dept) # 高置信:自动处理 else: escalate_to_human(dept, conf) # 低置信:转人工50% 流量自动化的前提下仍保持 92.2% 准确率——这是"选择性自动化"能落地的关键。
快速上手:三步接入
pip install deepopenfrom deepopen import Router router = Router(preload=True, device="cuda") # 预加载,亚35ms路由 res = router.predict(state, questions) # 一次调用,多题并答 print(res["answers"]["department"]["choice"]) # -> billing (0.94)生产环境可只预加载所需检查点(router.preload(["english", "multilingual"]))或用 LRU 策略(Router(max_loaded=2))控制显存。若已有业务数据,还可用 notebooks/laya_finetune_typed_decisions_2xT4_kaggle.ipynb 在 Kaggle 免费 2×T4 上 4–5 小时完成领域微调,将基线准确率从 0.36 提升到 0.766。
总结:用三种题型装下 90% 的决策需求
| 你的需求 | 选哪个原语 | 一句话输出 |
|---|---|---|
| 属于哪一类 | choice | 最优标签 + 概率 |
| 程度多高 | score | 0 到 N 的期望分 |
| 是否发生 | noul | 校准概率 0–1 |
DeepOpen 的价值不在于"又一个模型",而在于把企业 AI 决策收敛为三种可组合的题型:不生成文本、零幻觉、33 毫秒出结果、置信度可门控、自托管零推理成本。如果你的场景是分类、排序、预警,这三种题型大概率已经够用。
【免费下载链接】deepopen非自回归System 1决策引擎,专为结构化类型决策场景设计 DeepOpen Multilingual, non-autoregressive System 1 decision engine.项目地址: https://gitcode.com/gh_mirrors/de/deepopen
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考