公司动态

[具身智能-642]:CPU、GPU、NPU、BPU 通俗对比

📅 2026/7/25 15:59:58
[具身智能-642]:CPU、GPU、NPU、BPU 通俗对比
先建立一个生活化比喻修建一栋大楼CPU 总工程师什么活都能干但人手少GPU 一大群普通工人能同时干大量重复粗活粗糙、单一NPU 专门训练 / 跑神经网络的专业施工小队BPU 只做视觉 AI 任务、流水线高度优化的自动化工厂一、逐个通俗解读1. CPU中央处理器全能总工程师特点少量超强通用计算核心擅长逻辑、分支判断、调度管理。✅ 能干程序调度、ROS2、运动规划、逻辑判断、复杂分支、文件管理、驱动控制、算法决策。❌ 不擅长成千上万次重复卷积、大规模并行张量运算。类比一个经验丰富的总工看得懂图纸、协调各方、随时处理突发问题但搬砖速度很慢。在机器人系统里处在控制面、管理面调度硬件不适合大规模 AI 运算。2. GPU图形处理器海量通用工人集群特点几百上千个简单计算核心主打大规模并行计算。最初用来渲染游戏画面后来发现并行能力极强被拿来训练 AI 模型。✅ 能干模型训练、通用矩阵运算、图形渲染、各类并行任务。❌ 短板架构通用没有针对神经网络做极致优化大量中间数据反复读写内存功耗、延迟偏高。类比几百个工人可以一起搬砖但是没有专用流水线原材料、半成品来回搬运浪费时间和电力。3. NPU神经网络处理器通用叫法特点面向神经网络设计的专用处理器市面上叫法很泛瑞芯微、寒武纪、华为昇腾 NPU。专为卷积、激活、矩阵运算优化砍掉 GPU 多余图形单元。✅ 能干通用CNN、Transformer 各类神经网络推理支持多种网络结构。❌ 短板大多属于通用 AI 加速器没有针对图像流水线深度定制无法直接对接相机 ISP 的 YUV 原始数据流。类比一个专业 AI 加工厂可以加工多种神经网络通用性强但没有和上游图像采集流水线打通。4. BPU地平线 Brain Processing Unit伯努利架构属于 NPU 的一类但高度垂直定制定位面向嵌入式视觉场景专用 NPU。核心差异化和相机 ISP 图像链路深度融合、数据流架构、重视片上缓存、原生支持 NV12 输入。✅ 独有优势可以直接接收相机输出 NV12YUV420硬件内置预处理缩放、色域转换、归一化图像不需要经过 CPU 搬运转换数据流驱动架构依靠片上SRAM 复用特征图减少 DDR 内存读写低延迟、低功耗针对目标检测、视觉感知、SLAM 视觉前端等任务深度优化。❌ 短板通用性弱极度偏向视觉任务非视觉类 AI大语言模型运行效率一般。类比一条一体化自动化流水线。上游相机相当于原料传送带原料NV12 图像直接送入车间中间半成品尽量不搬出厂房片上缓存一气呵成完成视觉推理。二、核心差异简明对照表表格处理器核心定位优势场景最大短板机器人 RDK 场景分工CPU通用调度、逻辑运算系统管理、ROS2、运动规划、NMS 后处理、业务逻辑并行算力弱跑 AI 推理很慢控制面、管理面GPU通用大规模并行计算PC 端模型训练、通用仿真功耗高、内存搬运开销大嵌入式性价比低基本不在边缘机器人使用通用 NPU通用神经网络加速各类 AI 模型推理通用性强无法直连 ISP 图像流经常需要 CPU 预处理图像通用嵌入式 AI 设备BPU边缘视觉专用 AI 加速器MIPI 相机多路视觉推理、目标检测、视觉感知偏向视觉大模型通用性一般数据面核心算力单元承接所有视频链路 AI 推理三、关键通俗结论结合视觉链路CPU 不要用来跑持续的图像 AI 推理。它是指挥官不是苦力只负责调度、决策、后处理。GPU 适合电脑上训练模型不适合小型机器人 7×24 低功耗实时感知。普通 NPU 能跑 AI但是图像先要经过 CPU 转换处理多一道工序延迟更高。BPU 最大价值打通「ISP 相机 → AI 推理」硬件流水线。 相机输出 NV12 直接喂进 BPU硬件内部完成 YUV 插值、色域转换、CNN 推理数据尽量不走 CPU实现最低时延完美契合机器人视觉链路。四、一句话极简背诵版CPU 管调度决策GPU 适合电脑训练通用 NPU 能跑各类 AIBPU 是专为嵌入式视觉打造的 AI 硬件和相机图像链路无缝配合实现低延迟、高效率的实时视觉推理。