跳转到主要内容

字节跳动Seedance 2.5:AI视频现在能在30秒内讲述完整故事

字节跳动刚刚发布了Seedance 2.5,对于任何曾尝试让AI视频感觉不仅仅是随机片段的人来说,这都是一个重大消息。新模型将单次视频生成时间从15秒翻倍到整整30秒,而且不仅仅是长度——而是叙事。不再是孤立的镜头,你现在可以获得一个完整的叙事,有开头、中间和结尾,全部在一次拍摄中完成。

该模型正在即梦AI和豆包专业版上逐步推出,API访问将很快通过火山引擎提供。这意味着它不仅仅是为了好玩——它为电影、广告、教育、工业制造甚至自动驾驶打开了大门。

那么,这里真正的新东西是什么?Seedance 2.5保持了统一的多模态视听架构,但真正的突破在于长叙事能力、多模态参考和编辑。用简单的话说:AI视频不再是随机场景拼接在一起。它们现在可以讲述一个连贯的故事。

Image

一次拍摄,完整故事

以官方演示为例:一位歌手的表演被单次拍摄捕捉。镜头从红色帷幕后面开始,移动到温暖的后台化妆间,年轻女歌手调整耳机,工作人员提醒她该上台了,她穿过走廊,与搭档击掌,拿起麦克风,走上舞台。镜头拉远,展示整个体育场——观众、灯光、荧光棒、欢呼声。所有这些都发生在30秒内,而且不是随机序列;它遵循一个逻辑叙事弧:铺垫、发展、转折、结局。

更令人印象深刻的是多轮扩展。你可以基于现有视频再生成30秒,模型保持主要角色、场景、视觉风格甚至音效的一致性。在另一个演示中,一个男孩拿着足球跑出地铁车厢,男主角追他,最终抓住了他。动作流畅衔接——没有突兀的剪辑,没有奇怪的故障。

输入一切,获得人群场景

Seedance 2.5还允许你输入多达30张图片、10个视频片段和10个音频片段作为参考材料。模型从所有这些输入中理解构图、场景、风格、角色和道具,并根据你的指令应用它们。这对于多人场景来说是一个改变游戏规则的功能。它可以同时重现多个角色的外貌和声音,同时保持主要主体的稳定。

在官方示例中,一个30秒的音乐会片段使用了16:9横屏,电影写实风格。参考材料包括钢琴家、大提琴家、小提琴家、歌手、管弦乐队、合唱团和观众。结果?一个连贯的多角色场景,感觉就像由真正的导演拍摄的。

这对创作者意味着什么

当AI视频从“特效玩具”演变成可以处理完整叙事和群体调度的东西时,短视频创作的工具包可能需要认真重写。对于创作者来说,这意味着花更少时间拼接片段,更多时间专注于故事本身。对于广告或教育等行业,这可能意味着只需几个提示就能制作高质量的视频内容。

但让我们不要过于超前。该模型仍在推出中,我们必须看看它在现实场景中的表现。尽管如此,潜力是巨大的。如果Seedance 2.5兑现其承诺,我们可能正在看到一个新时代,AI不仅生成视频——它讲述故事。

关键点

  • 30秒单次拍摄:Seedance 2.5可以一次生成完整、连贯的视频,最长30秒。
  • 多轮扩展:你可以将视频再延长30秒,同时保持角色、场景和风格的一致性。
  • 丰富的参考支持:输入多达30张图片、10个视频和10个音频片段来指导生成。
  • 群体叙事:处理多个角色和复杂场景,保留外貌和声音。
  • 可用性:在即梦AI和豆包专业版上推出,API访问即将通过火山引擎提供。