FLUX 3 与 mimic:视频生成即机器人控制

Flux 3 X Mimic: The Next Generation of Video-Action Models

FLUX 3 与 mimic:视频生成即机器人控制

Black Forest Labs 的 FLUX 3 多模态基础模型正与 mimic robotics 联手,打造下一代视频动作模型 FLUX-mimic。该模型的核心逻辑在于:生成逼真视频需要理解物理世界的因果律,而这正是控制机器人所需的能力。通过 Self-Flow 技术,FLUX 3 在统一架构下同时优化了生成质量与特征表示,使得在真实工厂环境中,机器人能轻松处理线缆组装等复杂任务。这意味着,我们不再需要为内容创作和物理 AI 分别训练模型,一个理解世界的模型即可同时胜任两者。

如果同一个模型既能生成视觉内容又能控制机器人,那它从来就不只是一个内容创作模型,而是一个关于世界如何运作的模型。
  1. GiffertonThe3rd

    视频在 3 分 30 秒左右,机械臂尝试了三次才重新装好窗框饰条,这一幕相当让人不安——我以前从未见过这种解决方式。这是新出现的吗?还是我完全落伍了?

  2. vessenes

    非常有意思。核心结论是:一个训练良好的多模态视频生成模型内部已经包含了一个世界模型。他们做了一些工作,将这个世界模型提取出来并部署到机器人上,看起来效果不错。

    一方面,这并非新想法,高质量的视频模型显然对材质、光线和世界(至少在奥卡姆剃刀意义上的“理解”)有认知。不过据我所知,还没有哪家视频实验室转型成了机器人实验室;这或许会是首例,或者是一条事后看来显而易见的新商业模式:训练视频模型,售卖视频生成服务,扩大规模,再利用规模优势去训练机器人相关技术:盈利。

    他们的手部设计让我很感兴趣——看起来像是手套里藏了一堆东西;Xiami 刚发布的 Robotics-1 基础模型展示了一些用户训练的视频,用的是一些看起来很标准的夹爪;甚至到了有人戴上夹爪型手套来拍摄视频以训练该模型的程度。

    BFL 模型看起来完全不需要这些。鉴于硬件侧的难度,我很期待看到他们接下来会怎么做。

  3. flufluflufluffy

    好吧,这里的措辞,真是——

    > 然而,与更专门化的表示学习方法相比,它们产生的表示解耦程度较低,这限制了它们在需要世界理解的任务中的实用性。

    只有 LLM 才会用“解耦程度较低”这个概念来解释为什么“解耦程度较低”的表示在模拟现实世界时没那么有用,而它用来解释这个概念的表述本身却是“更纠缠(more entangled)”。

  4. altern8

    太棒了。

    让我感到难过的是,我们拥有所有这些了不起的技术,但电影却比以往任何时候都更糟糕。

    我通常只能看几十年前的电影才能找到点像样的作品,而令人惊叹的是,当年那些看起来傻乎乎的木偶,其叙事能力却比现在强上一千倍。

    这大概是个无关的牢骚,抱歉。

  5. rlupi

    很高兴看到欧洲初创企业之间的合作。

同日更多故事

2026-07-24