80 美分芯片实现语音识别与 TTS

Speech Recognition and TTS in less than 500kb

80 美分芯片实现语音识别与 TTS

Moonshine Micro 是一款专为微控制器设计的开源 AI 语音工具包,它让语音交互在资源极度受限的设备上成为可能。基于售价仅 80 美分的 Raspberry Pi RP2350 芯片,该系统集成了语音活动检测、命令识别以及神经语音合成技术,整个运行所需内存低至 470 KB。开发者可以利用 TensorFlow Lite Micro 库,在嵌入式设备上构建完整的语音代理,甚至实现通过语音配置 WiFi 连接。这套方案不仅代码开源且采用 MIT 许可,还展示了如何在极小的 Flash 和 SRAM 预算下,通过时间共享机制高效运行复杂的神经网络模型,为物联网设备带来了全新的交互体验。

Moonshine Micro 是专为微控制器和 DSP 等嵌入式系统处理器设计的版本,其参考平台是售价仅 80 美分的 Raspberry Pi RP2350。
  1. clayhacks

    我写了一个小小的 Python 封装,用来提供一个兼容 OpenAI/elevenlabs 的 HTTP 接口:https://github.com/clayrosenthal/bootlegger

  2. sgt

    演示视频的快捷链接:https://www.youtube.com/watch?v=kMliOFYBiz4

  3. nutanc

    太棒了。我正在尝试构建一个规模在 20-25MB 以内的完整 ASR 系统。既然现在有了 Claude code 可以跑实验,我就开始动手试了。目前的成果很有希望。第一个发现是,仅用 3300 个嵌入向量(786 维)就能捕捉到语音的细微差别。这个序列可以用一个小规模的 CTC 系统解码成文本。接下来的实验是将 768 维空间压缩到 64 维空间,这也显示出了一些有希望的结果。我正在把系统配置成让代理每天发布博客更新结果 [1]。所以我的研究“claw”配置会自动运行实验并发布结果,我早上检查并根据需要调整实验方向。虽然还没完全自动化,但已经快到了。

    [1] https://blog.trulm.com/posts/speech-as-independent-parts/

  4. almogo

    STT/TTS 系统对我来说总是看起来很有希望,但我几乎从未用过语音来操作电脑。有时候在手机上,我会用语音听写代替打字。我很想用语音来控制 Claude code,但我总觉得我说话的方式和我写出好提示词的方式很不一样。

    这里想听听大家的经历,有没有谁有好的 TTS/STT 使用体验?

  5. jedberg

    你有什么准确率基准测试吗?

    我在这个领域工作过。小体积的 TTS 并不是难点——难的是做得准确。

    不过对于 OP 针对的使用场景来说,低一点的准确率可能也够用了!

同日更多故事

2026-07-18