Ask HN: Существуют ли AI-модели для генерации звуков на основе текста и референса?
Ask HN: Are there AI models for generating sounds based on a text and reference?
Я долго не могу найти решение. Неужели нет коммерческой модели, в которую можно подать референсный звук и текстовую инструкцию и получить на выходе другой звук? Сейчас мультимодальные входы для изображений или текста на выходе — это уже решённая и стандартизированная задача: можно задать промпт для изображения и использовать референсное изображение, чтобы направить модель. Я также использовал текстовый и аудиовход, чтобы получить текстовое описание или классификацию. Но для Audio + text -> Audio я никак не могу найти решение. Мой сценарий — генерация новых звуковых эффектов на основе источника, у которого не так много чистых примеров, и я думал, что это ещё один решённый рабочий процесс, но ничего не нахожу. Пробовал elevenlabs SFX, но там только text->audio, и без референса сложно управлять только текстом и воссоздавать звук с какой-либо точностью. Пробовал модель Stable Audio 3, которая supposedly делает то, что мне нужно, но результаты были ужасными. Эта модальность застряла там, где генерация изображений была в 2016 году. Есть ли что-то ещё, или это просто не распространённая потребность?