ZHDA204 June   2026 MSPM0G5187

 

  1.   1
  2.   摘要
  3.   商标
  4. 1简介
  5. 2带 TinyEngine NPU 的 MSPM0G5187
  6. 3边缘 AI 工具链
    1. 3.1 TI Edge AI Studio
    2. 3.2 TI Tiny ML Tensorlab
    3. 3.3 TI 神经网络编译器
  7. 4边缘 AI 应用领域:数字识别
    1. 4.1 LeNet-5 变体 CNN 模型
    2. 4.2 NPU/CPU 性能比较
  8. 5边缘 AI 应用领域:波形分类器
    1. 5.1 特征提取
    2. 5.2 时序分类模型
    3. 5.3 模型内存注意事项
    4. 5.4 NPU/CPU 性能比较
  9. 6总结
  10. 7参考资料

模型内存注意事项

在资源受限的嵌入式平台上开发边缘 AI 解决方案,需要平衡一个严格的三维优化组合:算法性能(准确性、延迟)、非易失性存储 (FLASH/ROM) 和运行时内存 (SRAM)。

  • 算法性能:包括推理准确性和延迟,这两者主要由模型架构决定(包括网络深度、层宽度和算子复杂度)。
  • 静态储存内存 (Flash/ROM):主要由模型的总参数量(权重和偏置)决定。在完全量化的 INT8 流水线中,每个参数直接对应一个字节的闪存存储。因此,通道宽度扩展的更深网络会线性地增加静态二进制文件大小。有时,输入特性维度的变化也会影响静态内存使用(例如,在全连接层中)。
  • 动态运行时内存 (SRAM/RAM):由输入特性大小以及中间层产生的激活张量(特性图)决定。当时间序列切片在网络中传播时,处理核心必须分配临时工作区来存储层的输入和输出。更长的输入时间窗口或更高的特性维度会指数级地增加峰值运行时 RAM 需求。

受这些硬件现实驱动,边缘部署迫使人们摆脱传统的“准确性优先”思维。相反,成功的部署需要进行细致的权衡,将原始模型性能直接与静态闪存和峰值动态 SRAM 的硬性物理边界相平衡。

为了说明这种关系,表 5-5 量化了波形分类器在不同模型大小和输入特性配置下的内存占用和资源利用情况。

表 5-5 模型内存分析
模型变体(参数)闪存 (ROM) 大小RAM 大小@输入= 64RAM 大小@输入= 128RAM 大小@输入= 256
CLS_1K约 5.6KB约 2.7KB约 5.3KB约 10.4KB
CLS_4K约 9.9KB约 1.2KB约 1.7KB约 2.7KB
CLS_13K约 21.4KB约 2.3KB约 3.3KB约 5.3KB

在所有输入维度下,最小的模型 (CLS_1K) 所消耗的运行时 RAM 始终是较大模型(CLS_4K 和 CLS_13K)的两到四倍。这种看似不合常理的行为源于参数数量和运行时内存是由截然不同的架构决策所驱动的。CLS_1K 采用浅层拓扑结构,缺少早期下采样,导致大幅值、高分辨率的特性图在整个中间层持续占用内存。相比之下,CLS_4K 和 CLS_13K 采用更深层的架构,并在网络前端引入带步长的卷积,能够立即缩减时间维度,从而显著减小中间运行时张量的大小。