模型

字节跳动多模态视频模型 · ByteDance Seed

Seedance 2.0 模型指南:多模态音视频生成

基于官方资料梳理 Seedance 2.0 的输入方式、原生音频、可控性、实际局限和 Genflow 当前参数。

在 Genflow 中尝试最近审核: 2026年9月1日
Seedance 2.0 workflow context
Genflow 工作流示意,仅用于说明使用场景,不代表模型基准测试结果。

先说结论

Seedance 2.0 是字节跳动 Seed 团队的多模态音视频联合生成模型,可同时理解文本、图片、音频与视频参考。官方发布资料介绍了最长 15 秒的多镜头音视频输出、双声道同步音频、续写和定向编辑能力。

什么时候选择它

Seedance 2.0 适合需要文生视频、图片引导或参考生视频的短商业内容。当任务需要最长 30 秒或更大规模的参考素材时,再优先选择 Seedance 2.5。

模型官方事实

官方资料怎么说

只呈现厂商官方记录的能力,并与 Genflow 产品参数分开。

四种输入模态

官方说明可在一个生成任务中组合文本、图片、音频和视频输入。

最长 15 秒多镜头输出

Seedance 2.0 支持最长 15 秒的多镜头音视频内容,并生成同步声音。

续写与定向编辑

可通过提示词续写视频,并修改指定片段、人物、动作或剧情内容。

Genflow

Genflow 当前支持

以下参数直接读取当前 Genflow 模型配置。

生成方式
首尾帧生视频, 参考生视频, 文生视频
时长
4 to 15 秒
画幅
16:9, 4:3, 1:1, 3:4, 9:16, 21:9
输出
480p, 720p, 1080p, 4k
原生音频
支持

适用方向

  • 文本、图片、视频参考和声音参考都能作为创作入口。
  • 在短视频时长、动作、镜头控制与原生音频之间取得较实用的平衡。
  • Genflow 主模型支持文生视频、首尾帧生视频和参考生视频。

需要审核

  • 官方发布资料提到多主体一致性、文字生成、复杂编辑和偶发音频失真仍有局限。
  • Genflow 的 Fast 与 Mini 版本比主模型少一些生成方式和分辨率选择。

Seedance 2.0

实际使用场景

商品短片

在一段短片中组合商品运动、氛围、声音和镜头指令。

参考驱动的广告概念

围绕 15 秒创意组合视觉、动作、分镜和声音参考。

快速创意测试

当迭代速度优先时,可在 Genflow 使用 Fast 或 Mini 版本。

FAQ

创作者常问的问题

Seedance 2.0 是什么?

它是字节跳动 Seed 团队推出的多模态音视频生成模型,可接受文本、图片、音频和视频参考。

Seedance 2.0 和 2.5 有什么区别?

Seedance 2.5 将单次生成从 15 秒提升到 30 秒,并支持更多参考素材和更精确控制。Seedance 2.0 仍适合较短内容,而且在 Genflow 当前提供更多生成入口。

Genflow 有 Seedance 2.0 Fast 和 Mini 吗?

有。Genflow 同时提供主模型、Fast 和 Mini 版本,但后两者的生成方式与输出参数相对更少。

官方一手资料

本页事实均根据以下官方模型资料审核。