Ask HN: テキストと参照音声から音を生成するAIモデルはありますか?

Ask HN: Are there AI models for generating sounds based on a text and reference?

私は、参照音声とテキスト指示を入力として、別の音を生成できる商用モデルを探していますが、なかなか見つかりません。画像生成では、テキストプロンプトと参照画像を組み合わせて出力をガイドすることが一般化していますが、音声の分野ではAudio + text -> Audio のソリューションが見当たりません。ElevenLabs SFX を試しましたがテキストから音声のみで参照音声が使えず、Stable Audio 3 も試しましたが結果はひどいものでした。このモダリティは2016年頃の画像生成の段階で止まっているように感じます。他に何か方法があるのか、それともこれは一般的なニーズではないのでしょうか?

この日のほかの記事

2026-10-06