FLUX 3 がロボットを動かす:動画生成モデルが物理世界を理解するとき

Flux 3 X Mimic: The Next Generation of Video-Action Models

FLUX 3 がロボットを動かす:動画生成モデルが物理世界を理解するとき

Black Forest Labs は、マルチモーダル基盤モデル FLUX 3 を公開し、mimic robotics との協業で開発した動画アクションモデル FLUX-mimic を発表した。FLUX 3 は画像・動画・音声を統合的に学習し、その過程で物理世界の理解を獲得する。アクション予測を追加しても動画生成品質は一時的な低下のみで回復し、単一のバックボーンで両方のタスクを実現できることを示した。mimic は FLUX-mimic を Audi の工場で実際に展開し、柔軟物の組み立てなど従来の自動化では困難だった作業をロボットに実行させることに成功した。

動画をリアルに生成するには、接触、動き、重さ、因果関係を学ぶしかなく、そのどれかを間違えると見た目がおかしくなる。

この日のほかの記事

2026-07-24