把语音识别塞进一颗单片机,代价写在四个数字里
编译自 MDPI Computation 2026, 14(5), 112 · 开放获取 CC BY 4.0
一个不需要联网就能听懂指令的玩具,听上去是很小的需求。但把它落到硬件上,问题立刻具体起来:模型要塞进闪存,推理要在内存里跑完,延迟要低到人感觉不到,功耗还得让纽扣电池撑得住。这四个约束互相挤压,最后变成了一个在几十 KB 的尺度上做取舍的问题。
先看硬件的三条线
论文选定的目标平台是 XIAO nRF52840 Sense,主控是 64 MHz 的 ARM Cortex-M4F,RAM 256 KB,Flash 1 MB,板载 MEMS 麦克风与六轴惯性测量单元,原生支持 TensorFlow Lite Micro 和 Edge Impulse。
资源约束来自可商用性,而不是芯片本身。虽然物理 Flash 有 1 MB,但论文引用的工程口径要求模型占用控制在 100 到 150 KB 以内;RAM 方面需要与小于 256 KB 的缓冲兼容;端到端延迟要求低于 50 ms。在毫瓦级的功耗预算下,传统大模型完全没有可能,论文的表述是 VGG-16 或 ResNet 这类架构因为参数规模到百万级、层级太深,内存占用与激活值存储双双超出范围,在 MCU 上不可行。
图1 TinyML 的资源预算与五个模型的 Flash 落点(依据原文第 2.2、4.1、4.5 节绘制)
五个模型,三种赢法
论文设计并对比了五种轻量卷积网络:AlexNet-Tiny、LeNet-Tiny、MobileNet-Tiny、VGG-Tiny 和 CustomCNN-Tiny。它们采用统一的骨架,卷积接卷积再接池化,末端接一个紧凑的全连接头,输出八个类别。任务从常见的二分类扩到了八个类别,包括 stop、no、go、yes、unknown、silence、noise_ambient 和 noise_sudden。数据集取自 Google Speech Commands 的受控子集,每段音频 1 秒、采样率 16 kHz,按 80% 训练、20% 测试划分,并且严格做到说话人独立,也就是同一个人的音频只会出现在训练集或测试集其中一侧。特征采用梅尔频谱图,并做 Z-score 归一化来稳定训练时的梯度收敛。
结果被分成了三块奖牌。VGG-Tiny 拿下最高分类准确率 89.81%,说明层级卷积对频谱时间特征的提取确实有效。MobileNet-Tiny 拿到效率最优,单次推理延迟 0.88 ms、能耗 14.4 µJ,是电池供电连续监听场景的合适选择。CustomCNN-Tiny 的 INT8 量化后 Flash 占用只有 42.9 KB,是五个模型里最小的,并且鲁棒性评分达到 1.000。
其余数字同样值得记。LeNet-Tiny 的准确率降到 67.92%,MobileNet-Tiny 是 79.12%,VGG-Tiny 的延迟 2.48 ms、能耗 41.0 µJ。体积最大的 AlexNet-Tiny 在 INT8 量化后占用约 106 KB,论文指出五个架构全部落在 150 KB 的约束之内。所有模型的延迟都远低于 50 ms 这条线。
图2 五种轻量架构在准确率、延迟、能耗与体积上的实测对比(依据原文表 5、表 6 绘制)
二分类的老数字不能直接比
论文专门做了一组横向对照,把已有文献里的成绩摆出来:LeNet-Tiny 曾做到 98.55% 准确率、71.6 KB 的 TFLite 体积;MobileNet-Tiny 靠深度可分离卷积把内存压到 42.4 KB,准确率 97.88%。这些数字明显比本文的 89.81% 高,但两者的任务难度不同。既有的多数研究只做二分类,本文扩到八类多分类,还要额外引入 unknown、静音和环境噪声这几类容易混淆的标签,准确率下降是预期之内的。论文自己的判断是,多类别声学场景在 TinyML 约束下的研究一直是薄弱环节。
量化环节也有一个反直觉的发现。INT8 训练后量化按常规理解能把模型体积压到四分之一,但论文的实测结论是,量化并没有一致地缩小模型体积,主要收益反而体现在推理速度上。这个结论对做端侧部署的人有直接参考价值,因为量化常常被当作省 Flash 的手段,而实际效果取决于框架和算子实现。
还没做完的部分
论文对自身局限的说明比较坦诚。测试用的是受控数据集,缺少真实混响、非平稳噪声和词表外声音;验证主要依赖硬件仿真,没有做完整的实时部署测量;硬件平台只有 nRF52840 一款,没有做跨 MCU 的对比。后续计划包括在真实嵌入式环境中验证、移植到带向量加速的 ESP32-S3 观察 SIMD 对延迟的影响、以及通过注入环境噪声和时间拉伸做数据增强来提升泛化能力。
把这篇论文放回 AI 玩具这个品类里看,它回答的其实是一个成本结构问题。离线语音的可行性不取决于模型有多聪明,而取决于在 150 KB、256 KB、50 ms 和毫瓦这几个数字围成的框子里,能塞进多少识别能力。框子是固定的,能变的是网络结构和量化策略,而这两样东西的调优空间,眼下还远没有用完。
|
内容来源:MDPI Computation 2026, 14(5), 112 原文标题:Design and Evaluation of a Compact VGG-Inspired CNN for Keyword Spotting in Resource-Constrained TinyML Systems 作者:Wilson Gustavo Chango, Mayra Barrera, Daniel Maldonado-Ruiz, Julio Balarezo, Marcelo V. Garcia, Geovanny Silva 原文链接:https://doi.org/10.3390/computation14050112 许可协议:CC BY 4.0(https://creativecommons.org/licenses/by/4.0/) 配图说明:图1、图2 为本文依据原文献数据自行绘制。 改动声明:本文在其基础上进行了中文编译与删节,未改变技术结论与原始数据。 |





