← 文章 / AI技术
GitHub 6天前 · 2026-07-19 14:30:29 · 1 阅读

500kb 以内实现语音识别和 TTS

itemprop="text">

Moonshine Micro — 微控制器语音交互方案

Moonshine Voice 是一款开源 AI 工具包,专为开发者打造实时语音代理和应用。Moonshine Micro 是针对微控制器和 DSP 等嵌入式系统处理器优化的版本,以仅售 80 美分的 Raspberry Pi RP2350 作为参考平台。该方案集成了语音活动检测指令识别神经语音合成功能,最低仅需 470 KB 内存即可运行。

完整的演示演示见下方视频:

Moonshine Micro demo video

内存和计算需求经过专门设计,完美适配资源受限的系统。以下数据基于RP2350 演示,详细的内存预算对各项开销做了拆解:

组件 Flash SRAM (峰值) 算力
VAD (语音活动检测) ~89 KiB ~36 KiB ~0.8 MMAC/帧 (~25 MMAC/s)
STT (SpellingCNN 语音转文字) ~1.3 MiB ~346 KiB ~36 MMAC/s
TTS (神经双音素合成 @ 16 kHz) ~1.8 MiB 语音包 ~340 KiB ~37 MMAC 典型回复 (~65 MMAC/s 输出)
总计 (演示管线) ~3.6 MiB ~468 KiB 配置* 识别 + 播报 ~0.7–1.0 秒

说明:

  • Flash 为 .text + .rodata,使用 arm-none-eabi-size 在默认 moonshine_micro_echo 固件上测量(包含嵌入式神经语音包);SRAM 为 .bss + 堆 + 栈。
  • *VAD、STT 和神经 TTS 按顺序运行,共享一个约 384 KiB 的 TFLM 内存区域,因此 SRAM 不叠加 — ~468 KiB 是 520 KiB RP2350 上配置的总内存 (wifi_hardware ~491 KiB)。
  • MAC 为一次乘加运算;MMAC/s 为活跃期(非空闲)的每秒百万次运算。
原始来源: GitHub

评论 (0)