FLUX 3 공개: 이미지·비디오·오디오를 하나로 학습하는 멀티모달 기반 모델
Black Forest Labs가 멀티모달 파운데이션 모델 FLUX 3를 Early Access로 공개했다. FLUX 3는 이미지, 비디오, 오디오를 통합 아키텍처에서 동시에 학습해 세계에 대한 표현을 학습한다. Self-Flow 방식을 기반으로 계산 및 데이터 규모를 크게 확장했으며, 텍스트-비디오, 이미지-비디오, 비디오-비디오 생성, 멀티링궐 대화, 액션 예측 등 다양한 기능을 제공한다. 초기 평가에서 Runway Gen-4.5, Luma Ray 3.2 등 경쟁 모델보다 선호도가 높았으며, 향후 API, 가중치 공개, 오픈 웨이트 공개 등을 계획하고 있다.
각 모달리티는 동일한 현실의 투영일 뿐이며, 각각은 그 과정에서 일부 정보를 잃는다.