MiniMax H3 原生支持 ComfyUI:开放权重与 2K 视频

MiniMax H3 Day-0 Support in ComfyUI: Open Weights, Native Audio, and 2K Video

MiniMax H3 原生支持 ComfyUI:开放权重与 2K 视频

MiniMax H3 模型今日发布并开放权重,ComfyUI 在发布当天即实现原生支持。这款多模态视频模型不仅能生成高达 2K 分辨率、长达 15 秒的视频,还原生内置立体声音频,无需后期合成。通过剪枝调制权重和 int8 量化等优化技术,其显存占用降低了 66%,使得 RTX 3060 等消费级显卡也能本地运行。无论是文生视频、图生视频,还是基于参考素材的运动迁移,H3 都能在一个模型中完成多模态理解与生成,为本地创作者提供了强大的新一代工具。

音频是模型本身的属性,而非后期处理步骤,每一个音频输出都是原生立体声。
  1. embedding-shape

    我们发现模型的调制权重(约占参数总量的 40%)可以被剪枝并替换为功能等效的查找表,从而在输出质量没有任何损失的情况下,大幅缩小内存占用。

    假设这是真的,这种“无损”减少权重的做法常见吗?看起来简单得有点不可思议。如果这确实可行,它是否也适用于 LLM?

    原生支持逐帧生成很酷,但我很好奇在片段交界处“拼接”起来有多容易。通常模型在这些接缝处会丢失“动量”,如果能在片段之间通过逐帧生成来融合内容,感觉应该能解决这个问题。

  2. vblanco

    我在我的 4070ti super(16GB 显存)上运行这个,生成一段 10 秒的 480p 视频需要 10 分钟。但效果非常惊艳。

  3. sheesdev

    老鼠的渲染效果出乎意料地好。其中几个片段在目前的 SOTA 模型水平上代表了巨大的飞跃。

    唯一看起来有点“不对劲”的是饮料广告中开罐的那段,它仍然带有那种

同日更多故事

2026-08-03