FLUX 3 x mimic: Das neue Video-Action-Modell steuert Roboter bei Audi
Flux 3 X Mimic: The Next Generation of Video-Action Models
Black Forest Labs hat FLUX 3, sein multimodales Foundation-Modell, um eine neue Modalität erweitert: Aktionen. In Zusammenarbeit mit mimic Robotics entstand FLUX-mimic, ein Video-Action-Modell, das auf demselben Backbone basiert wie die Videogenerierung. Das Training auf Aktionen kostet laut BFL keine dauerhafte Leistung: Nach anfänglichen Einbußen bei der Videogualität erholte sich das Modell vollständig. Der Schlüssel ist die gemeinsame Weltrepräsentation, die durch das Self-Flow-Training entwirrt wird. FLUX-mimic erreicht bei Manipulationsaufgaben State-of-the-Art-Erfolgsraten, benötigt deutlich weniger Demonstrationsdaten und läuft in Echtzeit auf einem einzelnen NVIDIA RTX 5090. Bei Audi wird das System bereits in der Produktion getestet.
Wenn ein Modell beides kann – überzeugende visuelle Inhalte erzeugen und Roboter steuern –, war es nie wirklich nur ein Content-Erstellungsmodell. Es ist ein Modell dafür, wie sich die Welt verhält, und Content-Erstellung ist nur eine Sache, die man damit tun kann.