Ask HN: Gibt es AI-Modelle zur Generierung von Sounds basierend auf Text und Referenz?
Ask HN: Are there AI models for generating sounds based on a text and reference?
Ich habe Schwierigkeiten, eine Lösung zu finden. Gibt es wirklich kein kommerzialisiertes Modell, dem ich einen Referenzsound und eine Textanweisung geben kann, um einen anderen Sound zu erhalten? Ich habe elevenlabs SFX ausprobiert, aber es ist nur Text-zu-Audio und ohne die Referenz ist es schwierig, mit nur Text zu steuern und einen Sound mit Genauigkeit nachzubilden. Ich habe auch das Stable Audio 3 Modell ausprobiert, das angeblich das tut, was ich will, aber die Ergebnisse waren schrecklich. Diese Modalität scheint dort festzustecken, wo die Bildgenerierung 2016 war. Gibt es etwas anderes oder ist das einfach kein häufiges Bedürfnis?