嵌入式 AI(Edge AI)指将推理甚至训练能力下沉到终端设备(MCU、DSP、NPU、手机
  SoC、车载芯片等),而非完全依赖云端。

实现原理

  1. 模型层面:小而强

  - 轻量化网络:MobileNet、ShuffleNet、EfficientNet、SqueezeNet
    等用深度可分离卷积、通道混洗、神经架构搜索(NAS)降低参数量和计算量。
  - 知识蒸馏:用大模型(教师)指导小模型(学生)学习,使学生模型在更小体积下接近大模型精度。
  - 量化(Quantization):把权重/激活从 FP32 压缩到
    INT8、INT4,甚至二值/三值网络,减少存储和计算,配合定点运算单元加速。
  - 剪枝与稀疏化:去掉冗余连接或神经元,减少计算量;结构化剪枝更利于硬件并行。
  - TinyML:面向资源极度受限设备(几十 KB~几 MB Flash/RAM)的机器学习,典型框架如 TensorFlow Lite for Microcontrollers。

  2. 编译与运行时:适配硬件

  - 模型转换:PyTorch/TensorFlow → ONNX → 芯片专属格式(如 TFLite、NCNN、MNN、Tengine、MindSpore Lite)。
  - 算子融合与图优化:将 Conv+BN+ReLU 等合并,减少内存访问和调度开销。
  - 内存规划:嵌入式设备内存有限,需精细分配 tensor 生命周期,避免动态内存。
  - 推理引擎:针对 ARM Cortex-M、RISC-V、DSP、NPU 做算子优化和指令调度。

  3. 硬件层面:专用计算单元

  - CPU:ARM Cortex-M/A 系列、RISC-V,适合控制与轻量推理。
  - DSP:擅长向量运算和信号处理,常用于语音前端。
  - NPU/TPU:专用神经网络加速器,提供高 TOPS/W 能效比,如华为昇腾、地平线征程、高通 Hexagon、苹果 Neural Engine。
  - FPGA/ASIC:可定制数据流,适合特定应用和超低功耗场景。

  4. 软件栈

  典型链路为:

  数据采集(传感器/摄像头/麦克风)
      ↓
  预处理(信号处理、特征提取)
      ↓
  轻量化模型推理(TFLite / NCNN / 芯片 SDK)
      ↓
  后处理(滤波、决策、触发)
      ↓
  本地响应 或 选择性上传云端

 

 

Logo

作为“人工智能6S店”的官方数字引擎,为AI开发者与企业提供一个覆盖软硬件全栈、一站式门户。

更多推荐