Ask HN: ¿Existen modelos de AI para generar sonidos basados en texto y una referencia?
Ask HN: Are there AI models for generating sounds based on a text and reference?
He tenido dificultades para encontrar una solución. ¿Realmente no hay ningún modelo comercializado al que pueda darle un sonido de referencia y una instrucción de texto y obtener otro sonido? Actualmente, tener entradas multimodales para imagen o texto de salida es un problema resuelto y comercializado. Por ejemplo, puedes poner un prompt para una imagen y usar una imagen de referencia para guiar al modelo. También he usado entrada de texto y audio para obtener una descripción de texto o clasificación. No puedo encontrar una solución para Audio + texto -> Audio. Mi caso de uso es generar nuevos efectos de sonido basados en una fuente que no tiene muchos ejemplos limpios y pensé que sería otro flujo de trabajo resuelto, pero no encuentro mucho. Probé elevenlabs SFX pero es solo texto->audio y sin la referencia, es difícil guiar solo con texto y recrear un sonido con precisión. Probé el modelo Stable Audio 3 que se supone hace lo que quiero pero los resultados fueron terribles. Esta modalidad parece estar estancada donde estaba la generación de imágenes en 2016. ¿Hay algo más o simplemente no es una necesidad común?
La generación de audio condicionada por texto y referencia es un área de investigación activa, pero aún no está comercializada como la generación de imágenes. Hay algunos modelos de investigación como AudioLDM, MusicGen, y AudioGen que permiten condicionamiento por texto, pero la parte de referencia de audio es más complicada. Podrías intentar con enfoques de transferencia de estilo o adaptación de dominio.
He usado Stable Audio 2 y he obtenido mejores resultados que con Stable Audio 3. También puedes probar con modelos como Riffusion o Dance Diffusion, aunque no estoy seguro de que acepten referencia de audio. Para efectos de sonido, tal vez necesites entrenar tu propio modelo con pocos ejemplos usando técnicas de few-shot learning.
La razón por la que no ves soluciones comerciales es porque el problema es mucho más difícil de lo que parece. El audio tiene una dimensionalidad temporal y espectral compleja, y la evaluación es subjetiva. Las empresas se centran en texto a audio porque es más fácil de escalar. Para tu caso, podrías considerar usar un modelo de difusión entrenado en espectrogramas y luego convertir a audio, pero necesitarás datos de referencia.
Podrías intentar con el modelo AudioGen de Meta, que acepta texto y audio de referencia para generar efectos de sonido. También hay un proyecto llamado 'AudioLDM 2' que soporta múltiples modalidades. Sin embargo, la calidad puede no ser perfecta. Otra opción es usar un enfoque de recuperación: buscar en una base de datos de sonidos similares y luego modificar con texto.