音频生成为何还停留在2016年?
Ask HN: Are there AI models for generating sounds based on a text and reference?
我急需一个能结合参考音频和文本指令生成新音效的AI模型。目前图像生成已很成熟,但音频领域却找不到商业化方案。我试过ElevenLabs SFX和Stable Audio 3,前者无法用参考音引导,后者效果极差。难道这个需求真的不常见吗?
音频生成确实比图像难,因为声音的时间维度和频谱特性更复杂,目前业界还在探索阶段,没有像图像那样成熟的解决方案。
你可以尝试用Riffusion或MusicLM这类开源项目,虽然需要自己微调,但它们支持文本和音频参考输入,可能更适合你的需求。
这个问题可能源于数据稀缺。音效不像图像有海量标注数据,导致模型训练困难,商业化进展自然缓慢。