3TOPS算力、只2W功耗:端侧NPU的工业视觉算术题
一条PCB产线要求每秒60帧的视觉检测,每帧需要在500毫秒内完成瑕疵甲缺检测。这意味着单帧推理延迟不能超16毫秒,而产线旁边的边缘计算盒散热领域不超5W。这就是端侧NPU在工业视觉场景面临的算术题。
算力和功耗的同时极限
工业视觉质检对NPU的需求有两个同时约束:算力要够,功耗要低。一个典型的YOLOv8n模型在INT8量化下需要约3TOPS的算力,但产线环境的散热领域限制NPU功耗不能超2-3W。这意味着算力效率(TOPS/W)必须在1.5-2.0以上。
当前主流端侧NPU的算力效率已经可以做到3-5 TOPS/W,从参数上看是够用的。但这个数字是在裸子最佳工况下测出来的,实际工程中的算力利用率可能只有30-50%。
量化精度与检测漏检率的博弈
INT8量化是端侧部署的主流方案,但它带来了精度损失。对于工业视觉质检,漏检率和误检率的权衡是核心指标,而量化会影响边界案例的推理置信度。
一些厂商推出了混合精度方案:对关键层使用INT16或浮点计算,对非关键层使用INT8。这种方案可以在保证检测率的同时抑制功耗,但增加了NPU架构复杂度和编译器实现难度。
场景迁移的隐形成本
端侧NPU的梳子在编译器和场景适配。多数NPU厂商提供的编译工具链只能处理标准模型结构,对自定义算子、非标准网络结构的支持有限。工业视觉厂商往往需要对模型做定制修改,这就意味着每次产线换型都需要重新编译和调优。
更深的问题是长尾甲缺样本不足。工业场景中,甲缺往往只占样本总量的不1%,但恰恰是这些甲缺决定了检测系统的实际价值。端侧NPU的模型泛化能力对长尾缺的检测效果仍有限。
挑战与局限
端侧NPU面临的最大挑战不是算力不够,而是场景封闭性。一个NPU芯片设计时的算子集合是固定的,优化方向也是明确的,但工业场景的需求却是多变的。今天检测划痕,明天可能需要检测虚焊,后天可能要检测元器件偷移。模型的重训练和重新部署在产线环境中极其困难。
另一个局限是内存容量。端侧NPU的片上SRAM通常在1-4MB,而一个YOLOv8n的权重在INT8下约需7MB,需要外扫DRAM,这会引入延迟和功耗损耗。
判断与展望
端侧NPU在工业视觉场景已经过了可用门槛,但还没过好用门槛。从算力参数看,3TOPS、2W的组合已经能满足多数产线场景,但场景迁移的成本、模型泛化的局限和工具链的成熟度,使得端侧NPU的产业化落地仍在早期。未来2-3年,随着NPU编译器的成熟和模型格式的标准化,端侧NPU有望从样品走向规模化部署。但前提是,工业视觉供应商必须建立自己的模型生态,而不是简单地复用消费级NPU。
推荐阅读