字节跳动Seedance 2.5:AI视频现在能讲述30秒的故事
字节跳动正式发布了其最新的视频生成模型Seedance 2.5,将单个视频的最大长度从15秒翻倍至30秒。该模型正在即梦AI和豆包专业版上逐步推出,API服务即将集成到火山引擎中,为电影、广告、教育、工业制造甚至自动驾驶等应用打开大门。

据该公司称,Seedance 2.5保留了统一的多模态视听联合生成架构,但核心突破在于增强的长叙事能力、多模态参考和编辑。简而言之,AI视频不再只是零散的片段——它们现在可以交付一个完整的创作,有开头、中间和结尾。
一镜到底,完整故事
在官方演示中,一个歌手表演的连续单镜头以清晰的叙事逻辑展开。镜头从红色幕布后面开始,移动到温暖的后台化妆间,年轻的女歌手调整耳机,工作人员提醒她该上台了。她穿过通道,与搭档互动,拿起麦克风,最后走上舞台。镜头拉远,展现整个体育场——观众、灯光、荧光棒和欢呼声都在一个无缝的镜头中捕捉。该模型可以在30秒内组织多个逻辑相连的镜头——铺垫、发展、转折和结局。
无缝扩展故事
多轮扩展能力同样令人印象深刻。该模型可以基于现有视频继续生成另外30秒,同时保持主角、场景、视觉风格甚至音效的一致性。在另一个例子中,一个男孩抱着足球跑出地铁车厢,男主角追赶并最终抓住了他。连续动作无缝衔接,没有脱节感。
轻松处理复杂场景
Seedance 2.5在单次输入中支持多达30张图片、10个视频片段和10个音频片段作为参考材料。该模型全面理解不同材料中的构图、场景、风格、角色和道具等元素,并根据指令准确应用。在多人场景中,它可以同时还原多个角色的外貌和声音,同时保持主体稳定。官方的30秒音乐会片段使用16:9横屏,电影写实风格,参考材料涵盖了钢琴家、大提琴家、小提琴家、歌手、管弦乐队、合唱团和观众。
当AI视频从“特效玩具”演变为能够处理完整叙事和群体调度的工具时,短视频创作的工具包可能需要再次改写。
关键要点
- 30秒单镜头视频,具有连贯的故事情节
- 多轮扩展在额外的30秒片段中保持一致性
- 支持多达30张图片、10个视频和10个音频片段作为参考
- 处理复杂的多角色场景,保持主体稳定
- 在即梦AI和豆包专业版上推出,API通过火山引擎提供