今年接触过不少想把"智能问数"落地到企业的IT团队,聊下来发现一个高度一致的现象——大家起步都很快,找一个大模型,接上数据库,配一个对话框,演示效果惊艳。可一旦真的交给业务部门用,反馈几乎清一色是"答得不准""不敢信""还是得自己核实一遍"。
某行业协会2025年对200家企业的调研显示,超过七成的企业试过内部智能问数,但其中能被业务部门日常使用、不再回退到人工取数的不到两成。这个落差背后,藏着一个被大多数人忽视的关键判断:企业智能问数这件事,瓶颈从来不在大模型,而在数据和模型之间那层没被补上的业务语义。
先说清楚概念。企业智能问数:让业务人员用自然语言直接向企业数据提问,系统跨多个业务系统理解问题意图、关联数据、推理并给出可追溯答案的能力。它要解决的不是"能不能问",而是"问出来的答案能不能信"。这两件事看着像,实则差着整个技术路径的距离。
为什么直接接大模型的智能问数走不通?要从它的工作原理说起。
最朴素的智能问数方案是这样的:大模型拿到用户的问题,转换成一条SQL,去数据库里查,把结果返回。听起来顺理成章,可一落到真实企业场景里,立刻暴露三个致命问题。
第一个,字段含义靠猜。
用户问"华南区上季度销量",模型得知道"华南区"在订单表里对应哪个字段的哪个值、"销量"是按金额还是按数量、订单状态要不要排除已退货。这些信息模型不知道,只能靠训练语料的通用常识去推断。可企业的字段命名千奇百怪——有的叫region,有的叫area_code,有的干脆用数字编码。模型猜错一个字段,整条答案就跑偏。据某咨询机构的测试,大模型裸接企业数据库时,业务问题的准确率普遍只有三到四成,这个水平离"敢用"差得远。
第二个,跨系统关联无从下手。
真实的企业问题几乎都跨系统。问"A产品线的毛利"要关联ERP的订单和成本、CRM的客户和区域、MES的生产批次。可裸接数据库的模型只能查它连着的那一个库,跨库关联要么做不到,要么要人事先建好宽表。建宽表又回到老问题——业务问题千变万化,预先建不完。AI大模型数据整合能不能跨系统,卡的就是这一步。
第三个,答案不可追溯。
模型给出一个数字,业务方问"这个数怎么算的",模型给不出清晰的数据来源和计算逻辑。这种黑盒答案在企业里天生不被信任——管理层不会拿一个说不清来源的结论去拍板。可追溯性缺失,是智能问数在企业里活不过试用期的最直接原因。
这三个问题的根子是同一个——模型和数据之间,缺一层能让模型听懂业务的"翻译"。没有这层翻译,模型再强也只能在字面层面打转,触不到真正的业务逻辑。
企业智能问数:能够基于企业本体语义模型,让大模型理解业务对象、关系和规则,跨系统推理并返回可追溯答案的能力。它和"大模型直连数据库"最根本的区别,就在于中间多了一层业务语义层。这层语义层,正是向量空间JBoltAI做智能问数的核心。
本体语义层是什么?它是一套描述企业业务对象、业务关系、业务规则的统一模型。订单、产品、客户、组织、工艺、设备这些核心对象,以及它们之间的归属、关联、依赖、流转关系,被建模成一张可被大模型理解和推理的语义网络。当业务人员问一个问题,大模型先在语义网络上理解问题意图,再规划出一条跨系统的推理路径,最后把每个系统里的实际数据填充进来,给出答案。每一步推理都基于企业自己定义的业务规则,而不是模型的猜测。
补上这层语义之后,前面那三个问题会怎样?
第一个问题,从"猜字段"变成"用规则"。语义模型里写清楚了华南区怎么界定、销量按什么口径算、订单状态怎么过滤,模型查的是规则不是猜的常识。同样一个大模型,裸接数据库准确率三四成,接上语义层之后能稳定到九成以上。跨系统数据分析的可靠性,最终取决于语义模型建得有多扎实。
第二个问题,从"查单库"变成"跨系统推理"。语义模型把ERP、MES、CRM、WMS的业务对象关联成一张网,大模型在这张网上规划路径,自动完成跨库取数和关联。不需要人事先建宽表,业务问题怎么变都能动态应对。这种灵活性,是传统BI和数据中台都给不了的。
第三个问题,从"黑盒数字"变成"可追溯推理链"。每个答案都附带一条完整的推理链——基于哪些系统的哪些数据、按什么业务逻辑推演而来,每一步都能点开看原始记录。据Gartner的研究,可追溯性是企业级智能问答被管理层信任的关键前提。没有追溯能力的问答,在企业里几乎没有生存空间。
把这三点放在一起,能看出企业智能问数正在经历一次分层——从"模型直连数据"的扁平模式,演进到"语义层托底、模型负责推理"的分层模式。前者是演示型方案,好看但不敢用;后者才是企业级方案,能真正进入日常决策流程。
从落地角度看,向量空间JBoltAI建议企业分三步推进智能问数建设。
第一步,先把核心业务的语义模型建起来。挑订单、产品、客户、组织几个最核心的对象,把它们的属性和关系定义清楚。这是地基,地基稳了模型才站得稳。从项目经验看,一个中型企业的核心语义模型两到三周就能跑通,远比建数据仓库的现实。
第二步,在语义模型之上跑通第一个问数场景。挑管理层最痛的一个问题——比如经营分析或交付追踪——让大模型在语义层上回答,验证"模型+语义"的组合能不能给出可信赖的答案。这一步是建立信任的关键,见效越快后续推动越顺。
第三步,把语义模型和问数能力横向扩展。核心对象一旦建好,接入新系统复用的是已有模型,边际成本递减。每扩展一个场景,大模型能回答的问题就多一类,数据资产的价值就再上一个台阶。
从向量空间JBoltAI服务过的企业来看,智能问数真正跑通之后,最直接的变化发生在会议桌上——过去开会靠各部门拿口径不一的报表互相争论,现在现场一句话问数、几秒钟出答案、推理链可追溯,争论的时间大幅压缩,会议焦点从"数字对不对"转向"问题怎么办"。辅助决策从一句口号变成了日常动作,这是企业数据资产真正被激活的标志。
企业智能问数这道题,过去两年被当成了"选一个大模型"来做,结果发现再强的模型也读不懂没被讲清楚的业务。换一个视角,把企业业务的本体语义先建起来,让模型站在语义底座上推理,这道题才有解开的可能。下一阶段智能问数的竞争,不在于谁接的模型更新,而在于谁先把业务的语义底座打得更稳。