Inflect-Micro-v2: Komplette Sprachsynthese in 9,36 Millionen Parametern
Inflect-Micro-v2: complete voice in 9.36M parameters

Owen Song veröffentlicht Inflect-Micro-v2, ein lokales Text-to-Waveform-Modell mit nur 9,36 Millionen Parametern (37,53 MB FP32), das qualitativ hochwertige englische Sprachsynthese auf CPU oder CUDA ermöglicht. Es bietet deterministische Seeds, lange Textverarbeitung und erreicht in einer verblindeten Community-Studie eine Präferenzrate von 66,2 %. Das Modell ist Teil einer Familie mit dem kleineren Nano-v2 (3,97M Parameter) und wird mit ausführlichen, überprüfbaren Evaluierungsdaten veröffentlicht, einschließlich UTMOS22, ASR-Verständlichkeit und CPU-Laufzeit.
Ich habe Inflect v2 unabhängig aufgebaut und finanziert. Wenn diese Veröffentlichung ein echtes Publikum findet, möchte ich das Projekt mit einem breiteren v3 fortsetzen, das möglicherweise weitere Sprachen, Stimmen und Stabilitätsverbesserungen umfasst.