Ask HN: 텍스트와 레퍼런스를 기반으로 사운드를 생성하는 AI 모델이 있나요?
Ask HN: Are there AI models for generating sounds based on a text and reference?
저는 레퍼런스 사운드와 텍스트 지시를 입력하면 새로운 사운드를 출력하는 상용화된 모델을 찾기 어려움을 겪고 있습니다. 이미지나 텍스트 출력을 위한 멀티모달 입력은 해결된 문제인데, Audio + text -> Audio는 찾을 수가 없습니다. 제 사용 사례는 깨끗한 예시가 많지 않은 소스를 기반으로 새로운 사운드 효과를 생성하는 것인데, ElevenLabs SFX는 텍스트->오디오만 지원하고 레퍼런스가 없어 정확도가 떨어집니다. Stable Audio 3 모델도 시도했지만 결과가 형편없었습니다. 이 모달리티는 2016년 이미지 생성 수준에 머물러 있는 것 같습니다. 다른 방법이 있나요, 아니면 이건 흔한 필요가 아닌가요?