Seedance 2.5:一次生成30秒完整故事
字节跳动 Seed 团队推出了新一代视频生成模型 Seedance 2.5,将单次生成时长从15秒提升至30秒,并支持多轮扩展以创作分钟级长视频。该模型在长叙事、多模态参考和精准编辑上取得突破,允许用户一次性输入多达30张图像、10段视频和10段音频作为参考,显著提升了对复杂场景和角色一致性的控制力。通过优化镜头过渡、物理细节及音画同步,Seedance 2.5 致力于消除AI视频的“人工感”,让创作者能更高效地从创意直达成片。目前该模型已在 Jimeng AI 和 Doubao Pro 上线,API 即将通过 BytePlus ModelArk 开放。
用户现在可以一次性输入多达30张图像、10段视频和10段音频作为参考材料,让模型更精准地捕捉创作意图并实现跨越多个主体、场景和镜头变化的复杂创意。
HN 评论区
19- neom
推特上有位女士用 Seedance 制作了她和 Anthropic 的 Dario 的视频,风格有点怪诞,但整体质量相当高:https://x.com/CuiMao/status/2058458683781365873(全集:https://x.com/CuiMao/status/2082740754380984373)——看到这些视频是我第一次对 AI 视频生成感到惊艳。
- jjcm
质量确实很高,但有个观察是:这些模型的演进方向与中国和西方的使用需求高度相关。具体来说,它们极度专注于文生视频(t2v)中的动作/高特效镜头。整个发布页面上只有一张人物参考图,而且那张图完全没聚焦对话。
我接触过的一些美国电影人表示,他们最大的需求是视频生视频(v2v),这样可以将演员的表演迁移到任何他们想要的场景中。不过中国电影市场略有不同——它高度偏向动作片和高特效大片。看看这份在北美票房惨败但在中国大卖的好莱坞电影清单:
《魔兽》(中国票房:2.25 亿美元,美国:4700 万美元)
《生化危机》(中国:1.59 亿美元,美国:2700 万美元)
《极限特工:终极回归》(中国:1.64 亿美元,美国:4400 万美元)
《环太平洋:雷霆再起》(中国:9900 万美元,美国:5900 万美元)
一种解读是,动作片和视觉奇观比依赖对话的电影更具普适性。另一种解读是,中国文化上普遍更偏好这类内容。我推测字节跳动之所以聚焦动作/特效,是因为他们看到了这方面的市场需求。
- Genego
每当我看到视频生成(以及图像生成)模型的新发布,都会起鸡皮疙瘩,因为用它们干活实在太有趣了。但随即我又想起,我花在推理上的费用超过 1 万美元,生成了 5 万多张用于故事板的图片,训练了模型;大概还生成了近一小时的视频(我猜)。是的,我明白如果不使用最新模型,成本可以更低(我做过一些案例研究),但最新模型用起来最爽。这不像周末搞搞“氛围编程”(vibe coding)那样容易规模化。而当效果真的很好时,简直就像第一次看到 zoopraxiscope(活动视镜)活过来一样,你只想一直做下去。
我收到过几家初创公司邀请我合作,但看起来很多初创公司做的东西似乎没什么价值(比如为 YouTube 或 TikTok 短视频批量制造垃圾内容),甚至直接违背道德伦理(如克隆/深度伪造等)。但看到这个领域的进展,加上我本身有电影制作背景,我可能最终会被自然吸引到这个领域,在工程层面摸索出点门道。正如你所见,我做了很多纯粹为了好玩的东西,并记录了过程:https://edwin.genego.io/blog(不过年初就停更了……也许……会重新捡起来。
- ronsor
Seedance 2.5 看起来太棒了,但 MiniMax H3 将在 24 小时内开源权重:https://fal.ai/minimax-h3。据 ComfyUI 团队称,它甚至能在像 3080 这样的中端消费级 GPU 上获得可接受的运行效果。
说实话,我愿意为了更高的可控性和更低的成本而接受轻微的质量损失。
- r0fl
在哪里能用 Seedance 制作电影?必须注册第三方服务吗?他们有官方应用吗?我是不是漏掉了什么?还是有 API?
我就是搞不明白!!
没有愚蠢的问题,只有愚蠢的人……
但在搞懂这件事上,我就是那种人。
- damsta
我认为音频、图像或视频生成技术根本不该存在。我还没看到足够多的正面应用,能证明这些工具被用来造成的伤害是合理的。
- JimsonYang
我想看看 Seedance 2.5 在 1080p 下的表现,对比 Seedance 2.0 在 4K 下的表现,看看哪个模型更胜一筹。
根据我们的经验,投入更多资金就能买到更好的电脑,从而获得更优的提示词生成效果。
- mcintyre1994
在我看来,这效果异常出色,比我之前见过的都要好。他们那个洗衣机广告示例,质量似乎和社交媒体上其他任何内容一样好。我对他们能保持的质量和连贯性感到震惊,我猜他们在使用提示词中提到的那些参考图像方面做得非常好。我觉得唯一明显糟糕的是音乐厅那个场景:前几秒显示几乎空无一人的座位区,而到了结尾却出现了满座的观众,而且那些观众看起来也有点不对劲。