FLUX 3:统一多模态的视觉智能新基石

FLUX 3:统一多模态的视觉智能新基石

FLUX 3 现已开启 Early Access,这是一款全新的多模态基础模型。它不再孤立地学习图像、视频或音频,而是在统一架构下联合训练,旨在理解世界的本质:物体如何结合、事物如何运动以及事件如何发声。FLUX 3 基于 Self-Flow 技术,能够生成带有原生音频的视频,并具备强大的图像合成与编辑能力。在早期评估中,它在捕捉人类面部表情、关联声音与物理事件以及多语言支持方面表现突出,甚至在部分对比中优于 Grok Imagine Video 和 Kling v3 Pro。此外,FLUX 3 还延伸至动作预测领域,与 mimic robotics 合作开发了 FLUX-mimic,为物理 AI 和机器人操作提供了新的动力。

单独学习一种模态只能得到该投影的良好模型,而同时学习所有模态,它们之间的相互约束会告诉你更多:声音必须匹配撞击,运动必须服从质量,未来必须源于过去。
  1. user43928

    希望开源权重版本能达到 SOTA 水平。

    > 在接下来的几周和几个月里,我们将提供以下功能:

    > 开放多模态主干模型的权重,用于内容创作(视频、音频和图像)及动作预测。(

  2. thisisauserid

    - 几乎没展示任何包含人物的示例。

    - 轻率地使用“世界模型”这一术语。

    - 声称能生成 20 秒视频,展示的却全是跳剪片段。

    敬请期待!

  3. jdthedisciple

    这里的评论如此消极和 dismissive,简直令人难以置信,而我却觉得这个模型看起来确实能力惊人。

    不过话说回来,我听说那些唱衰的人总是第一个在这里留下恶评的,咱们走着瞧……

  4. forgotusername6

    有没有人给模型喂过触觉数据?机器人主要需要做的似乎是去触碰物体,但我们喂给它们的只有音频、视频和图像。模型必须在从未触碰过任何东西的情况下学会如何触碰。也许这就是为什么它们触碰物体时看起来总是那么犹豫不决?

  5. AmbroseBierce

    太惊人了。这将是未来的基石,让机器人能够分辨穷人靠近贝索斯/马斯克/扎克伯格地下掩体时的声音,并迅速适应大众发起的任何新型攻击。机器人将快速学习适应攻击者的行为,迅速推断出他们的聚集位置、人数等等。

    当然,不同家族派系的机器人之间会有摩擦,但这些摩擦将微乎其微,因为它们彼此学习得太快,很快就会演变成伤亡惨重的对称性机器人冲突,这类冲突很可能被避免。毕竟,在任何资源争夺中,对付人类要容易得多。

    这确实是技术的巅峰,尽管对人类而言未必如此。

  6. Gecko4072

    我还以为这些片段是真实拍摄的呢,直到看到他们在积水的房间里跳舞。

  7. make_it_sure

    来自欧洲的第一个让人充满希望的 AI 成果。

  8. tormeh

    这些人是在……弗莱堡招聘吗?好奇他们在那里的招聘情况如何。

同日更多故事

2026-07-24