ZHDA204 June 2026 MSPM0G5187
在资源受限的嵌入式平台上开发边缘 AI 解决方案,需要平衡一个严格的三维优化组合:算法性能(准确性、延迟)、非易失性存储 (FLASH/ROM) 和运行时内存 (SRAM)。
受这些硬件现实驱动,边缘部署迫使人们摆脱传统的“准确性优先”思维。相反,成功的部署需要进行细致的权衡,将原始模型性能直接与静态闪存和峰值动态 SRAM 的硬性物理边界相平衡。
为了说明这种关系,表 5-5 量化了波形分类器在不同模型大小和输入特性配置下的内存占用和资源利用情况。
| 模型变体(参数) | 闪存 (ROM) 大小 | RAM 大小@输入= 64 | RAM 大小@输入= 128 | RAM 大小@输入= 256 |
|---|---|---|---|---|
| CLS_1K | 约 5.6KB | 约 2.7KB | 约 5.3KB | 约 10.4KB |
| CLS_4K | 约 9.9KB | 约 1.2KB | 约 1.7KB | 约 2.7KB |
| CLS_13K | 约 21.4KB | 约 2.3KB | 约 3.3KB | 约 5.3KB |
在所有输入维度下,最小的模型 (CLS_1K) 所消耗的运行时 RAM 始终是较大模型(CLS_4K 和 CLS_13K)的两到四倍。这种看似不合常理的行为源于参数数量和运行时内存是由截然不同的架构决策所驱动的。CLS_1K 采用浅层拓扑结构,缺少早期下采样,导致大幅值、高分辨率的特性图在整个中间层持续占用内存。相比之下,CLS_4K 和 CLS_13K 采用更深层的架构,并在网络前端引入带步长的卷积,能够立即缩减时间维度,从而显著减小中间运行时张量的大小。