GitHub 6天前 · 2026-07-19 14:30:29 · 1 阅读
500kb 以内实现语音识别和 TTS
itemprop="text">
Moonshine Voice 是一款开源 AI 工具包,专为开发者打造实时语音代理和应用。Moonshine Micro 是针对微控制器和 DSP 等嵌入式系统处理器优化的版本,以仅售 80 美分的 Raspberry Pi RP2350 作为参考平台。该方案集成了语音活动检测、指令识别和神经语音合成功能,最低仅需 470 KB 内存即可运行。
完整的演示演示见下方视频:
内存和计算需求经过专门设计,完美适配资源受限的系统。以下数据基于RP2350 演示,详细的内存预算对各项开销做了拆解:
| 组件 | Flash | SRAM (峰值) | 算力 |
|---|---|---|---|
| VAD (语音活动检测) | ~89 KiB | ~36 KiB | ~0.8 MMAC/帧 (~25 MMAC/s) |
| STT (SpellingCNN 语音转文字) | ~1.3 MiB | ~346 KiB | ~36 MMAC/s |
| TTS (神经双音素合成 @ 16 kHz) | ~1.8 MiB 语音包 | ~340 KiB | ~37 MMAC 典型回复 (~65 MMAC/s 输出) |
| 总计 (演示管线) | ~3.6 MiB | ~468 KiB 配置* | 识别 + 播报 ~0.7–1.0 秒 |
说明:
- Flash 为
.text+.rodata,使用arm-none-eabi-size在默认moonshine_micro_echo固件上测量(包含嵌入式神经语音包);SRAM 为.bss+ 堆 + 栈。 - *VAD、STT 和神经 TTS 按顺序运行,共享一个约 384 KiB 的 TFLM 内存区域,因此 SRAM 不叠加 — ~468 KiB 是 520 KiB RP2350 上配置的总内存 (
wifi_hardware~491 KiB)。 - MAC 为一次乘加运算;MMAC/s 为活跃期(非空闲)的每秒百万次运算。
原始来源: GitHub