跳转到主要内容

字节跳动Seedance 2.5:AI视频现在能讲述30秒的故事

字节跳动正式发布了其最新的视频生成模型Seedance 2.5,将单个视频的最大长度从15秒翻倍至30秒。该模型正在即梦AI和豆包专业版上逐步推出,API服务即将集成到火山引擎中,为电影、广告、教育、工业制造甚至自动驾驶等应用打开大门。

Image

据该公司称,Seedance 2.5保留了统一的多模态视听联合生成架构,但核心突破在于增强的长叙事能力、多模态参考和编辑。简而言之,AI视频不再只是零散的片段——它们现在可以交付一个完整的创作,有开头、中间和结尾。

一镜到底,完整故事

在官方演示中,一个歌手表演的连续单镜头以清晰的叙事逻辑展开。镜头从红色幕布后面开始,移动到温暖的后台化妆间,年轻的女歌手调整耳机,工作人员提醒她该上台了。她穿过通道,与搭档互动,拿起麦克风,最后走上舞台。镜头拉远,展现整个体育场——观众、灯光、荧光棒和欢呼声都在一个无缝的镜头中捕捉。该模型可以在30秒内组织多个逻辑相连的镜头——铺垫、发展、转折和结局。

无缝扩展故事

多轮扩展能力同样令人印象深刻。该模型可以基于现有视频继续生成另外30秒,同时保持主角、场景、视觉风格甚至音效的一致性。在另一个例子中,一个男孩抱着足球跑出地铁车厢,男主角追赶并最终抓住了他。连续动作无缝衔接,没有脱节感。

轻松处理复杂场景

Seedance 2.5在单次输入中支持多达30张图片、10个视频片段和10个音频片段作为参考材料。该模型全面理解不同材料中的构图、场景、风格、角色和道具等元素,并根据指令准确应用。在多人场景中,它可以同时还原多个角色的外貌和声音,同时保持主体稳定。官方的30秒音乐会片段使用16:9横屏,电影写实风格,参考材料涵盖了钢琴家、大提琴家、小提琴家、歌手、管弦乐队、合唱团和观众。

当AI视频从“特效玩具”演变为能够处理完整叙事和群体调度的工具时,短视频创作的工具包可能需要再次改写。

关键要点

  • 30秒单镜头视频,具有连贯的故事情节
  • 多轮扩展在额外的30秒片段中保持一致性
  • 支持多达30张图片、10个视频和10个音频片段作为参考
  • 处理复杂的多角色场景,保持主体稳定
  • 在即梦AI和豆包专业版上推出,API通过火山引擎提供