FLUX 3:统一多模态的视觉智能新基石

FLUX 3:统一多模态的视觉智能新基石

FLUX 3 现已开启 Early Access,这是一款全新的多模态基础模型。它不再孤立地学习图像、视频或音频,而是在统一架构下联合训练,旨在理解世界的本质:物体如何结合、事物如何运动以及事件如何发声。FLUX 3 基于 Self-Flow 技术,能够生成带有原生音频的视频,并具备强大的图像合成与编辑能力。在早期评估中,它在捕捉人类面部表情、关联声音与物理事件以及多语言支持方面表现突出,甚至在部分对比中优于 Grok Imagine Video 和 Kling v3 Pro。此外,FLUX 3 还延伸至动作预测领域,与 mimic robotics 合作开发了 FLUX-mimic,为物理 AI 和机器人操作提供了新的动力。

单独学习一种模态只能得到该投影的良好模型,而同时学习所有模态,它们之间的相互约束会告诉你更多:声音必须匹配撞击,运动必须服从质量,未来必须源于过去。

同日更多故事

2026-07-24