当 AI 开始走出数字世界,进入真实业务现场,行业关注的问题也正在从大模型能做什么,转向模型能力如何变成可以长期、稳定运行的产品。
一个新场景,如何更快启动?
面对不断出现的长尾问题,算法如何持续迭代?
在不同设备、算力与业务流程中,模型能力又如何真正进入现场?
2026 WAIC 期间,格灵深瞳以生态合作形式,分别在百度、海光信息和瑞芯微展台,展示视觉智能工坊 VE²S 及其在视频解析、泛安防和工业质检等场景中的应用。
此次首次线下公开亮相的VE²S-GBOX,也让从云端算法生产,到现场推理、执行与数据回流的完整链路,有了更加具象的产品载体。
AI 原生架构,构建视觉智能体系
在百度展台,格灵深瞳重点展示了视觉智能工坊 VE²S 的整体产品架构,以及 VE²S-GBOX 的硬件形态。
VE²S-GBOX 亮相百度展台现场
但 VE²S 并不是一个盒子。
它是一套面向真实行业场景打造的 AI 原生的视觉智能产品体系,打通数据采集、智能标注、模型训练、算法运营、边缘部署、业务反馈与模型迭代,帮助客户围绕自身业务,持续生产、运营和优化视觉智能能力。
在这套体系中:
MENTOR面向云端或中心侧,负责数据处理、模型训练、效果评测与算法持续迭代;
EXPERT承接算法全生命周期运营,将通用模型能力转化为适配客户业务的专属算法;
GBOX则进入靠近摄像头、产线和设备的业务现场,完成设备接入、数据采集、边缘推理、事件判断、结果回传与数据回流。
三者共同形成一条从“现场运行—数据回流—算法迭代—再部署”的持续进化链路,也构成了视觉智能工坊 VE²S 的端到端产品体系。
这里的端到端,不仅是从模型训练到边缘执行的技术链路,也是从客户提出需求,到产品真正进入业务流程的落地链路。客户需要的不只是某一个算法,而是从算法训练、算法运营,到现场执行与反馈,都有可使用、可持续的产品承接。
正如格灵深瞳CEO吴一洲在 WAIC 现场接受采访时所说,最终交付的不是一个模型或技术名词,而是客户拿来就能用的产品。
新场景可以先借助多模态能力完成冷启动,再利用现场数据逐步提升效果;高频、稳定的任务交给小模型实时运行,复杂理解和长尾问题则由大模型参与分析与研判。大模型负责复杂理解,小模型承担高频执行,真实现场的数据再不断回到算法生产体系中,推动能力持续迭代。
全目标解析,深入行业应用
在海光信息展台,格灵深瞳展示了全目标视频解析能力与深眸视觉智能工坊(简称“深眸”)。
深眸亮相海光信息展台现场
全目标视频解析可面向人脸、人体、车辆、非机动车及事件等目标进行统一结构化分析,并结合海光信息的算力底座,呈现视觉算法在多元算力生态中的适配与部署能力。
在此基础上,深眸进一步将视觉智能工坊 VE²S 的通用能力,转化为面向泛安防场景的具体应用。它以公共安全算法为基础,融合格灵深瞳自研的泛安防行业化多模态大模型,贯通新场景模型训练、复杂任务编排、边缘推理与数据回流,可应用于社会治安防控、重点区域管控、办案中心合规及城市治理等场景。
面对人员聚集、异常行为、违规排查、生态治理、灾害预防等事件,深眸不只识别目标,还会结合多模型能力与业务规则,对告警进行筛选和研判,让识别结果真正进入业务流程。
这也体现了格灵深瞳对“做深”的理解:不是试图替代行业专家,而是把从基础模型、工具链到落地产品的每一个环节做成可用的工具,让技术人员与行业专家能够共同参与视觉能力的生产、运营与迭代。
从技术团队帮助专家使用,到陪伴专家使用,再到行业专家能够围绕自身业务自主生产和运营所需能力,正是 VE²S 面向大量行业长尾需求所要解决的问题。
质检能力下沉,扎进生产现场
在瑞芯微展台,格灵深瞳则以玩偶外观质检为例,展示 VE²S-GBOX 如何进入工业质检现场。
VE²S-GBOX 亮相瑞芯微展台现场
VE²S-GBOX 在端侧完成采集、计算与推理,对划痕、气泡、异色、缺胶等缺陷进行定位,并输出检测结果。面对不同尺寸、造型和 SKU,也可以通过切换采集配方与模型组合,快速适配新的产品类型。
质检过程中产生的疑难样本,也不会停留在现场。这些数据可以持续回流至 MENTOR,通过大小模型协同训练、评测和算法迭代,形成适配客户生产需求的专属算法,再部署回现场。由此形成一条能够伴随生产持续运行的数据闭环,让质检能力可以随着真实业务不断进化。
但 GBOX 的价值,并不只是把算法装进一个盒子。
吴一洲在采访中提到,端侧产品不能仅停留在视觉算法和硬件形态上,而要进一步形成业务层的判断、执行与反馈能力。只有模型、视觉智能、智能体与现场设备真正协同,端侧交付的才不只是算法,而是能够进入业务流程的判断结果与执行能力。
自研模型筑基,转化产品能力
支撑这套产品体系持续运行的,是格灵深瞳在视觉基础模型与多模态大模型方向的长期积累。自研视觉基础模型系列 GLINT-MVT,为图像和视频理解提供通用视觉表征能力,可支撑目标识别、分类、分割、检索及多模态应用。
多模态大模型 GLINT-VL的相关成果先后以 LLaVA-OneVision-1.5 和 LLaVA-OneVision-2.0 的名义全面开源。其中,LLaVA-OneVision-2.0 原生支持长视频全帧率理解,在保留全帧率感知能力的同时,有效降低视频 Token 消耗,进一步提升长视频理解、目标追踪、空间定位及复杂事件分析等任务的处理效率。
视觉智能工坊 VE²S 让模型与客户数据结合,形成专属算法,并贯通算法生产、运营与现场执行,使技术真正转化为客户拿来就能用、可以持续运营和迭代的产品能力。
从自研视觉模型出发,经过算法生产与运营,最终进入不同算力、设备和业务流程,并在真实现场持续获得反馈与迭代,这正是视觉智能工坊 VE²S 所构建的完整产品链路。
未来,格灵深瞳将继续围绕视觉智能工坊 VE²S,推进视觉基础模型、多模态大模型、算法生产平台与边缘软硬件的协同创新,让视觉智能从一次性交付,走向可持续运营;从“看见画面”进一步走向理解物理世界、服务真实业务。
让视觉智能真正进入现场,也在现场持续进化。