Inflect-Micro-v2:936 万参数实现完整语音合成
Inflect-Micro-v2: complete voice in 9.36M parameters

Owen 独立开发并资助了 Inflect-Micro-v2,这是一款在 936 万参数下即可实现完整本地文本到波形合成的英语 TTS 模型。它支持确定性种子生成、长文本处理,并可在 CPU 或 CUDA 环境下运行。在盲测中,该模型获得了 66.2% 的社区偏好率,UTMOS22 预测自然度得分高达 4.395,同时在 4 核 CPU 上实现了 6.28 倍实时推理速度。相比 KittenTTS Nano 和 Piper Low 等竞品,Inflect-Micro-v2 在保持极小模型体积(37.53 MB FP32)的同时,提供了卓越的音质和清晰度。如果该项目获得关注,作者计划推出支持更多语言和声音的 v3 版本。
A small voice can still have something meaningful to say.
HN 评论区
28- yjftsjthsd-h
几点亮点:
> 1000 万参数以下实现完整的本地文本到波形语音合成。
以防万一,像我一样希望“完整”语音意味着同时包含 STT 和 TTS 的朋友,这里澄清一下:并非如此。无意贬低,只是说明情况。
> 仅限英语,且只有一个固定的男声。这不是零样本语音克隆。
(随后是一堆关于局限性的陈述,我理解为“质量可能参差不齐,但如果你愿意折腾一下,应该没问题”)。不过嘛,在小于 1000 万参数的情况下,我就不挑刺了:)。
- modinfo
太神奇了,这么小的模型,音质简直让我大开眼界!我刚刚就用你的模型替换了我旧的 onnx 模型!
这里是我基于 speech dispatcher 和服务器的实现:
https://github.com/skorotkiewicz/inflect-speechd
感谢分享!
- NetOpWibby
语调有点怪,但这听起来不像机器人。不错!