先建立一个生活化比喻:修建一栋大楼
- CPU = 总工程师,什么活都能干,但人手少
- GPU =一大群普通工人,能同时干大量重复粗活(粗糙、单一)
- NPU =专门训练 / 跑神经网络的专业施工小队
- BPU = 只做视觉 AI 任务、流水线高度优化的自动化工厂
一、逐个通俗解读
1. CPU(中央处理器):全能总工程师
特点:少量超强通用计算核心,擅长逻辑、分支判断、调度管理。
✅ 能干:程序调度、ROS2、运动规划、逻辑判断、复杂分支、文件管理、驱动控制、算法决策。
❌ 不擅长:成千上万次重复卷积、大规模并行张量运算。
类比:一个经验丰富的总工,看得懂图纸、协调各方、随时处理突发问题;但搬砖速度很慢。
在机器人系统里:处在控制面、管理面,调度硬件,不适合大规模 AI 运算。
2. GPU(图形处理器):海量通用工人集群
特点:几百上千个简单计算核心,主打大规模并行计算。
最初用来渲染游戏画面;后来发现并行能力极强,被拿来训练 AI 模型。
✅ 能干:模型训练、通用矩阵运算、图形渲染、各类并行任务。
❌ 短板:架构通用,没有针对神经网络做极致优化;大量中间数据反复读写内存,功耗、延迟偏高。类比:几百个工人,可以一起搬砖;但是没有专用流水线,原材料、半成品来回搬运,浪费时间和电力。
3. NPU(神经网络处理器,通用叫法)
特点:面向神经网络设计的专用处理器,市面上叫法很泛(瑞芯微、寒武纪、华为昇腾 NPU)。专为卷积、激活、矩阵运算优化,砍掉 GPU 多余图形单元。
✅ 能干:通用CNN、Transformer 各类神经网络推理;支持多种网络结构。
❌ 短板:大多属于通用 AI 加速器,没有针对图像流水线深度定制;无法直接对接相机 ISP 的 YUV 原始数据流。
类比:一个专业 AI 加工厂,可以加工多种神经网络,通用性强,但没有和上游图像采集流水线打通。
4. BPU(地平线 Brain Processing Unit,伯努利架构,属于 NPU 的一类,但高度垂直定制)
定位:面向嵌入式视觉场景专用 NPU。
核心差异化:和相机 ISP 图像链路深度融合、数据流架构、重视片上缓存、原生支持 NV12 输入。
✅ 独有优势
- 可以直接接收相机输出 NV12(YUV420),硬件内置预处理(缩放、色域转换、归一化);图像不需要经过 CPU 搬运转换;
- 数据流驱动架构,依靠片上SRAM 复用特征图,减少 DDR 内存读写,低延迟、低功耗;
- 针对目标检测、视觉感知、SLAM 视觉前端等任务深度优化。
❌ 短板:通用性弱,极度偏向视觉任务;非视觉类 AI(大语言模型)运行效率一般。
类比:一条一体化自动化流水线。上游相机相当于原料传送带,原料(NV12 图像)直接送入车间,中间半成品尽量不搬出厂房(片上缓存),一气呵成完成视觉推理。
二、核心差异简明对照表
表格
| 处理器 | 核心定位 | 优势场景 | 最大短板 | 机器人 RDK 场景分工 |
|---|---|---|---|---|
| CPU | 通用调度、逻辑运算 | 系统管理、ROS2、运动规划、NMS 后处理、业务逻辑 | 并行算力弱,跑 AI 推理很慢 | 控制面、管理面 |
| GPU | 通用大规模并行计算 | PC 端模型训练、通用仿真 | 功耗高、内存搬运开销大,嵌入式性价比低 | 基本不在边缘机器人使用 |
| 通用 NPU | 通用神经网络加速 | 各类 AI 模型推理,通用性强 | 无法直连 ISP 图像流,经常需要 CPU 预处理图像 | 通用嵌入式 AI 设备 |
| BPU | 边缘视觉专用 AI 加速器 | MIPI 相机多路视觉推理、目标检测、视觉感知 | 偏向视觉,大模型通用性一般 | 数据面核心算力单元,承接所有视频链路 AI 推理 |
三、关键通俗结论(结合视觉链路)
- CPU 不要用来跑持续的图像 AI 推理。它是指挥官,不是苦力;只负责调度、决策、后处理。
- GPU 适合电脑上训练模型,不适合小型机器人 7×24 低功耗实时感知。
- 普通 NPU 能跑 AI,但是图像先要经过 CPU 转换处理,多一道工序,延迟更高。
- BPU 最大价值:打通「ISP 相机 → AI 推理」硬件流水线。 相机输出 NV12 直接喂进 BPU,硬件内部完成 YUV 插值、色域转换、CNN 推理,数据尽量不走 CPU,实现最低时延,完美契合机器人视觉链路。
四、一句话极简背诵版
CPU 管调度决策;GPU 适合电脑训练;通用 NPU 能跑各类 AI;BPU 是专为嵌入式视觉打造的 AI 硬件,和相机图像链路无缝配合,实现低延迟、高效率的实时视觉推理。