☰
国产AI算力芯片品牌全景盘点:从云端推理到边端部署的选型指南
2026/9/25 1:10:52 网站建设 项目流程

前阵子有个朋友找我咨询:"公司想上一套大模型推理服务,预算有限,又在国产化名单里,你说买哪家的卡合适?"我问他模型多大规模、并发多少、跑训练还是推理、放在机房还是边缘设备,他说:"不是就买算力芯片吗,越强越好呗。"这个回答恰恰暴露了很多人对国产AI算力芯片的误解——它不是一件商品,而是一堆方案,且不同方案的适用场景可能隔了十万八千里。

今天这篇就围绕一个核心问题展开:国产AI算力芯片到底有哪些品牌?为什么几乎所有人的目光都从训练场转向了推理和边端?我会把目前市场上能接触到的玩家按阵营拆开,结合推理场景的真实技术约束和边端部署的实操经验,给你一份可以直接用来做方案选型的参考。适合智算中心的采购、AI应用团队的架构师,以及所有打算在边缘设备上落地模型的开发者。

1. 先想明白一件事:突破口为什么是"推理"和"边端"而不是"训练"

1.1 训练芯片和推理芯片,本质上不是同一类芯片

在展开品牌名单之前,有个非常容易被忽略的事实:拿训练卡跑推理,和拿推理卡做推理,不是"性能打折"这么简单,而是两套完全不同的设计哲学。

训练阶段的负载特点是:batch size大、数据吞吐高、矩阵运算密集、对精度敏感(通常要FP16或BF16,甚至混合精度下需要FP32累积)。训练芯片要在"单位时间内塞进更多样本"这件事上尽量快,所以设计上会堆大量AI Core、堆高带宽显存,电源和散热预算可以拉到350W甚至750W。开一次训练任务,几千张卡嗡嗡嗡跑几个月,大家看的是总算力小时数。

但推理完全是另一副面孔。推理是部署阶段,面对的是单个用户的一次请求,batch size往往很小,经常是1到8之间的数字。这时候芯片的实际吞吐上限很少由"峰值算力"决定,而是由"电路里每个数据搬运的时间"决定,也就是业内常说的memory bound。于是你会发现一个反直觉的现象:某些标称500 TOPS的推理板卡,跑7B模型时可能还没有标称200 TOPS但带宽更高的卡快。

边端就更特殊了。边端芯片活在功耗、价格、散热、体积都极其苛刻的约束下,很多时候连主动风扇都没有,还要保证实时性。一台服务器可以用1000W的电源,但一台机器人、一个摄像头或一辆车里的AI盒子,可能只有5W到30W的预算。在这种局面下,比拼的已经不是"算力TOPS"这个数字,而是单位功耗下的有效算力,以及模型量化后精度还在不在。

1.2 需求爆发的时间窗口,恰好卡在推理侧

过去两三年有个明显现象:训练大模型的团队可能只有几百上千个,但使用大模型的用户已经到亿级。训练一次模型,可能用几千张卡跑几个月;但这套模型一旦部署,每天要为成千上万并发用户做推理。一个成熟的大模型服务,长期占用的推理算力往往是训练算力的数倍。

这个变化带来的结果就是:训练侧的高端芯片窗口期短、入围门槛极高,现在再想挤进去做纯训练卡,基本是地狱难度。而推理侧的需求是长尾的、分散的、场景化的——公有云要跑7B/14B/72B模型,私有化项目要跑1.5B/3B小模型,运营商和政企项目又普遍有国产硬件的门槛,摄像头、玩具、车载、教育硬件则要的是低功耗方案。没有任何一颗芯片能通吃所有场景,这种碎片化格局恰恰是国产AI芯片的机会结构,也是"推理与边端"成为突破口的最底层逻辑。

2. 国产AI算力芯片品牌全景盘点:谁在训练侧,谁在推理侧,谁在边端

其实"国产AI算力芯片"不是一个圈子,而是三个圈子:云端训推、推理卡、边端SoC。三个圈子的竞争格局完全不同,混在一起比反而容易得出错误结论。

2.1 能在云端训推上正面对位的玩家

先说声量最大的一档,也是能在云端大算力场跟国际主流产品掰手腕的几家。

华为昇腾是现在国产AI算力里最完整的一盘棋。训练有昇腾910B/910C系列,推理有Atlas 300I Duo和Atlas 800I A2等产品。昇腾不是简单复制GPU路线,用的是达芬奇架构,AI Core加Vector Core的异构设计,软件栈叫CANN,大模型推理引擎MindIE也逐步兼容了主流框架。在大模型训推全流程上,昇腾的解决包最完整,但它的工具链相对封闭,第三方厂商做适配和迭代的难度不小。

寒武纪是从边缘推理起家的,思元220时代就在做端侧推理,后来思元370做成训推一体,思元590把训练能力顶上来了。寒武纪的思元370推理卡在互联网大厂内部的实际部署量不小,INT8推理的能效比很能打,性价比一度很有竞争力。

海光走的是通用GPGPU路线,深算一号DCU兼容AMD ROCm生态,因此很多原本为CUDA写的项目在迁移时能借助兼容层减少部分改动。但兼容只是降低迁移成本,不等于不改代码,算子库、通信库、框架调度还有一堆细节要调。

沐曦的看点集中在训练卡,曦云系列对标通用GPU,策略上先攻训练后延伸推理,底层同样往ROCm方向靠。训练卡能不能在大模型集群里稳定跑起来,是它目前最关键的问题。

另外还有百度昆仑芯,R200/R300在百度内部业务上用量很大,但对外销售声量相对低调,暂时不展开。

2.2 把宝押在推理卡上的务实派

第二梯队更贴合"推理是突破口"这个判断,这些厂商的产品定义本身就偏推理场景。

燧原科技:云燧训练卡之外,云燧i10/i20推理卡在运营商、互联网项目里的曝光率很高。燧原的产品策略是专门为推理场景开模,不是拿训练卡降频当推理卡卖,所以功耗和单卡吞吐上有自己的优势。

天数智芯:天垓系列主打通用训练,智铠系列面向推理。智铠100在一些视频解析和轻量LLM推理项目里有落地。

壁仞科技:壁砺104、壁砺106走的是大算力路线,单卡算力冲得很高。真正限制它的是软件栈BIRENSuite的成熟度和应用案例,目前还在追赶阶段。

2.3 边端SoC:藏量最庞大的战场

边端是"品牌最多、最依赖场景绑定、最不透明"的领域。

地平线:征程系列覆盖自动驾驶,征程3、征程5、征程6系列,征程6P峰值算力能到560 TOPS。BPU架构在端侧做Transformer和BEV算法很顺,工具链和开发平台也是车端最完整的一档。

黑芝麻智能:华山系列A1000、A2000,还有跨域融合计算方向的武当C1200系列,覆盖自动驾驶和舱驾一体,跟地平线直接对位。

算能:从智能安防到智算盒子,BM1684X、SG2300X这些TPU在边缘视觉项目里出货量不小,配合TPU-MLIR工具链有自己的生态圈子。

爱芯元智:AX620、AX630、AX650系列主打端侧图像和轻量视觉推理,很多智能摄像头背后就是它。

瑞芯微、晶晨、全志这些老牌SoC厂商这两年齐齐把NPU规格拉了上来。瑞芯微RK3588上那颗6 TOPS的NPU,已经成为边缘小盒子开发者的首选入门方案;晶晨A311D广泛出现在交互屏、会议盒子、智能家居里;全志T527系列也把NPU加到了中低端硬件上。

海思:Hi3516CV610这类芯片在安防项目里非常常见,配合昇腾体系,端侧视觉推理链路的工具链比较成熟,网上从源码到板端部署YOLOv8的教程也因此多。

边端芯片跟云端芯片最大的不同在于:**没人会单独买"一颗芯片",大家买的是"一套能跑起来的解决方案"。**摄像头厂商不会先看NPU算力,只会问能不能顺利把目标检测模型跑上去,夜视效果如何、功耗多少、单颗成本多少、外壳尺寸能不能塞得下——每一项都卡得死死的。

2.4 一张表看清主要国产AI芯片玩家

厂商代表产品主攻方向需要重点考察的短板
华为昇腾910B/C、Atlas 300I Duo训练+推理+行业一体机工具链偏自有,迁入成本高
寒武纪思元370、思元590训推一体,推理性价比高高端训练集群性能仍需验证
海光深算一号DCU通用GPGPU,兼容ROCm软件层适配工作量不小
沐曦曦云C500训练为主,向推理延伸生态起步较晚
燧原云燧i10/i20云端推理训练侧声量较弱
天数智芯天垓150、智铠100训练与推理分线规模落地案例相对少
壁仞壁砺104/106云端大算力软件栈成熟度追赶中
地平线征程3/5/6汽车与自动驾驶非车载场景绑定不多
黑芝麻华山A1000/A2000汽车与舱驾融合工具链生态仍在成长
算能BM1684X、SG2300X边缘视觉、智算盒子工具链偏自研
爱芯元智AX630/AX650端侧图像、轻量推理大模型端侧能力一般
瑞芯微RK3588/RK3576边缘盒子、工控算力有限,适合中小模型

这张表没有把每个玩家的所有产品线列全,但已经足够说明一件事:国产AI算力芯片从来不缺品牌,缺的是"在正确的场景里选对正确的型号"。

3. 推理芯片选型逻辑:算力榜单会骗人,带宽和生态才见真章

3.1 峰值算力与有效吞吐,两组数字两套故事

我见过不止一个项目,拿着芯片标称的几百TOPS志得意满,结果实测跑一个7B模型,并发只有几十路,性能完全没跑起来。原因在于大模型推理过程其实可以拆成两段。

第一段叫Prefill(预填充):用户把问题发过来后,芯片要并行地把整段prompt算一遍,生成第一个token,这个阶段算力利用率高。第二段叫Decode(解码):芯片要一个token一个token地往外吐,每一步都依赖前一步,串行性质很强,这个阶段内存带宽才是天花板。只要Decode速度上不来,整体并发和时延就上不来。

标称TOPS是在矩阵全速跑起来的前提下测出来的,但推理的Decode阶段矩阵算力根本用不满,反而在拼命读KV Cache。所以选推理卡,我第一个看的是带宽,第二是显存容量,第三才是TOPS。这个顺序跟"越强越好"的直觉正好相反。

3.2 KV Cache、Continuous Batching与动态Shape

大模型推理时,每个请求都要为历史token维护一份KV Cache,它常驻显存。显存总量除以每个请求平均占用的KV Cache,才约等于这块卡能同时服务的请求数。所以显存容量不够,算力再高也只能干瞪眼。

另一个关键点是动态Shape和连续批处理(Continuous Batching)。vLLM能显著拉高吞吐,核心就是用PagedAttention解决KV Cache碎片化,再加上连续批处理让不同请求的动态加入和退出变得高效。如果一颗推理卡的驱动层和推理引擎对动态Shape支持不好,每次请求都要重新分配缓冲区,那批处理效率会大幅下降。这也是为什么国产卡需要花大量精力做推理引擎适配——很多时候不是芯片不行,而是软件层没有把芯片的批处理潜力释放出来。

3.3 本地部署和边缘推理容易踩的配置误区

热搜里总有人问"本地推理需要MacBook Pro吗""780M核显推理用什么工具合适",这里其实有个常被忽略的答案:本地推理从来不是非得靠高算力GPU,关键看你跑什么规模的模型、用多大的量化。

1.5B到3B的小模型,用INT4量化之后,参数只有1到2GB,一个中高端的核显、甚至一台ARM小板子就能跑,只是速度有快慢。这种场景下,llama.cpp、Ollama这类专门为低功耗设备优化的推理框架,反而比跑CUDA的大框架更合适。核心原则是:先把模型压缩到能塞进内存,再用工具链把带宽吃到极致,最后才考虑堆算力。

这套逻辑放到国产边端芯片上同样成立。很多芯片的标称算力只有在特定量化精度(INT8甚至INT4)和特定模型结构下才能发挥出来。评估一颗边端NPU时,一定要看它在目标模型、目标量化下的真实帧率,而不是看宣传页上的理论TOPS。

4. 边端芯片才是最卷的牌桌:从6 TOPS到560 TOPS怎么选

4.1 功耗、成本、实时性三个硬约束

边端芯片的选型逻辑和云端几乎是两个世界。第一个约束是功耗:车内AI盒子、摄像头、门禁、电子猫眼这些场景基本都是被动散热或小风扇,功耗预算通常在3W到30W之间。第二个约束是成本:一颗芯片的价格可能直接决定整个硬件方案能不能立项,所以在边端经常会看到"用更低算力但便宜得多的方案"的倾向。第三个约束是实时性:自动驾驶、工业质检、安防预警对单帧延迟极其敏感,不能接受云端那种几百毫秒的往返延迟,必须在本地完成推理。

所以在边端,比"谁算力高"更合理的维度是"有效算力/瓦"和"有效算力/元"。一个场景标称560 TOPS的车规芯片,和一颗6 TOPS的通用SoC,根本没有可比性,因为目标产品完全不同。

4.2 从PyTorch模型到板端落地要闯的五个关卡

从训练好的模型到它在板卡上跑起来,中间至少有五个环节,缺一个都跑不通:

  1. 模型导出:把PyTorch训练好的模型转成ONNX,或直接转成厂商自定义格式。
  2. 算子兼容性检查:板卡NPU支持的算子集合和GPU不完全一致,注意力机制、动态形状、某些激活函数经常要替换或融合。
  3. 量化校准:INT8/INT4量化需要准备校准数据集,用KL散度或最小化误差的方法确定各层量化参数,这一步直接决定精度损失多少。
  4. 编译与推理框架接入:在厂商工具链里做图优化、算子融合、内核生成,然后接runtime跑起来。
  5. 联调与性能优化:在真实设备上测帧率、延迟、功耗,必要时针对特定层做手工优化。

以YOLOv8为例,网上大量教程讲的是在Hi3516CV610或RK3588上从源码到板端的完整流程,核心套路都是:先转ONNX,再到厂商转换工具里做量化校准,编译成NPU专用二进制格式,最后用官方runtime调用。看起来步骤不多,坑却非常密集——量化后精度掉点、某个算子不支持导致整图回退到CPU慢速执行、内存布局不对导致性能腰斩,这些都是常态。

4.3 选边端工具链就是选平台

边端领域没有统一的"CUDA",每家有每家的工具链,这也是选型时最需要关注的隐性因素。瑞芯微是RKNN-Toolkit2配RKNN runtime,地平线是OpenExplorer工具链,算能是BMNNSDK配TPU-MLIR,海思则是一套从HiAI到昇腾相关工具链的体系。

如果你是算法团队,希望尽量少碰芯片细节,选择标准就两条:一是工具链对PyTorch和ONNX的支持覆盖度,二是社区案例数量。案例越多,意味着可查的踩坑记录越多,出问题时有人可问。目前RK3588在这一块的优势很明显,从模型转换到摄像头采集、Qt界面、NPU加速一条龙的教程遍地都是,所以很多开发者选它反而是最省力的。

5. 工具链与推理引擎适配:决定国产芯片能不能"用起来"

5.1 从CUDA生态迁移的真正难点在分层

这几年国产芯片厂商都有一个共同口号:兼容CUDA生态。但实际迁移过的人都知道,CUDA生态是分层的,有CUDA C/C++这种底层编程接口,有cuBLAS/cuDNN算子库,有CUDA graph执行调度,还有上层框架PyTorch、TensorFlow对算子的默认调度。兼容层一般只能做到"语法层面的翻译",不等于"性能等价"。

一个模型在A卡上收敛得很好,换到国产卡上跑,最常遇到的问题:某个算子在算子库里缺失,或者某个自研算子的精度和官方不一致,需要手动重写。推理场景相对训练会好一些,因为推理的计算图是固化下来的,可以提前做图优化和算子融合。这就是为什么"能跑推理的国产卡"比"能跑训练的国产卡"更容易先成熟。

5.2 vLLM与SGLang的适配现状

现在做大模型推理,行内人基本绕不开vLLM和SGLang。vLLM的PagedAttention解决了KV Cache碎片化问题,连续批处理大幅提升服务吞吐。SGLang则在调度开销和RadixAttention共享前缀上更激进,特别适合多轮对话和长提示词场景。如果还想从原理层面彻底搞懂PagedAttention和Continuous Batching的运行机制,从nano-vLLM这类教学级实现开始读是很好的路径,源码规模小得多,关键逻辑保留得还比较完整。

国产芯片要在这两个框架里被真正用起来,不能只靠厂商自研引擎,还必须做深度适配。目前昇腾、寒武纪都投入了不少工作,昇腾有MindIE,但也主动接入了vLLM的分支版本;燧原、沐曦也在各自推进兼容方案。对用户来说,选一颗能跑主流推理引擎的国产卡,远比选一颗只能跑厂商demo的卡重要,因为你的服务代码、调度逻辑、监控体系都是围绕这些开源框架写的,芯片只能跑私有引擎的话,整套技术栈就被绑死了。

5.3 自研引擎:全家桶体验与绑定的取舍

除了兼容主流框架,国产厂商也在自研工具链上做差异化。最典型的是昇腾的MindIE,不止是推理引擎,还包括模型转换、量化、性能分析在内的一整套工作流。好处是"全家桶"体验完整,官方说支持什么模型,调起来通常比较顺;坏处是你需要进入一整个新的知识体系,学习成本和排障成本都高。

我个人的判断是:真正能长期留下来的国产AI芯片公司,一定不是TOPS最多的,而是让算法工程师迁移成本最低的。工具链文档质量、报错信息的可读性、社区案例的密度,这些看不见的工程细节,最终决定了生产力和客户黏性。

6. 落到具体项目上的选型决策与个人判断

6.1 按业务形态推荐的选型框架

大型公有云或大规模训练集群,优先考虑昇腾、寒武纪这类有完整训练加推理方案的厂商,因为此时需要的是集群稳定性和持续迭代能力。企业私有化大模型推理,优先看寒武纪、燧原这类推理卡落地案例多的厂商,同时确认它对vLLM和SGLang的支持程度,显存容量是否跟得上模型规模。边缘视觉和智能硬件,根据成本目标来选:RK3588是最大公约数,车规场景看地平线和黑芝麻,安防行业绑定比较深的是算能和爱芯。轻量端侧AI玩具和交互设备,则适合晶晨、全志这类低功耗SoC,配量化后的小模型,主打性价比。

6.2 值得持续关注的三个演进方向

第一个是PD分离(Prefill/Decode分离)架构。把Prefill和Decode分别部署到不同类型的硬件上,让计算和访存各就各位,已经有一些国产芯片厂商在布局,这会重新定义推理卡的产品形态。第二个是内存扩展技术,让推理卡突破显存物理容量的限制,大模型推理的并发瓶颈会因此松动。第三个是端侧大模型的兴起,当3B甚至7B模型在端侧跑得足够顺时,边端芯片的市场空间会比现在再大一个量级,这是国产边端芯片最大的长期红利。

6.3 我在国产芯片上踩坑后的三点体会

第一,凡是宣传页上的性能,都要打一个问号,最终以自己目标模型实测为准,尤其是量化和动态Shape场景。第二,选型和采购时一定把工具链工程师的投入算进成本,有些芯片看着便宜,但团队要花两个月时间去磨算子转换和内存优化,总成本反而更高。第三,优先选社区案例多的硬件,哪怕性能略微逊色一点。因为当你的项目卡在某个算子报错时,能搜到一条别人的解决方案,比什么都值钱。

以后再有人问"国产AI算力芯片哪家强",我建议先反问一句:你的模型是什么、跑在什么场景、能接受多大的迁移成本。把这三个问题回答清楚,品牌清单自然会浮出水面。推理和边端之所以是突破口,不是因为训练不重要,而是因为任何模型的价值最终都要靠部署和推理来实现——而部署这件事,拼的就是场景理解、工程适配和长期服务的笨功夫。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询