FLUX 3: Ein Modell für Bilder, Videos und Audio – und die Welt dahinter
Black Forest Labs stellt FLUX 3 vor, ein multimodales Foundation-Modell, das Bilder, Videos und Audio in einer Architektur vereint. Das Modell lernt gemeinsame Repräsentationen der Welt, indem es die gegenseitigen Einschränkungen der Modalitäten nutzt. Erste Ergebnisse zeigen Stärken bei Video mit Audio (bis 20 Sekunden), Bildgenerierung und Aktion-Vorhersage. In frühen Vergleichen wird FLUX 3 Video gegenüber Runway Gen-4.5 und Luma Ray 3.2 bevorzugt. Der Zugang erfolgt schrittweise über Early Access, offene Gewichte sind geplant.
Die Modalitäten hören auf, getrennt zu sein, und werden zu Belegen für eine zugrunde liegende Realität.