ByteDance のマルチモーダル動画モデル · ByteDance Seed
Seedance 2.0 ガイド:マルチモーダル音声動画生成
入力方法、音声、制御、制約、Genflow の対応設定を公式情報に基づいて整理します。

先に結論
Seedance 2.0 は ByteDance Seed の統合型音声動画モデルです。テキスト、画像、音声、動画を参照し、最大15秒の複数ショット、同期音声、延長、部分編集に対応します。
選ぶべき場面
短い商品動画でテキスト、画像、参照素材を柔軟に使うなら Seedance 2.0 が実用的です。30秒または大規模な参照素材が必要なら Seedance 2.5 を検討します。
公式モデル情報
公式情報の要点
メーカーが公開した機能と Genflow の製品設定を分けて表示します。
4種類の入力
テキスト、画像、音声、動画を同じ生成タスクで組み合わせられます。
最大15秒の複数ショット
同期音声を含む最大15秒の複数ショット動画として紹介されています。
延長と部分編集
特定のクリップ、人物、動き、物語を指示で延長または修正できます。
Genflow
Genflow の対応
現在の Genflow モデル設定から直接表示します。
- 生成方法
- キーフレームから動画, 参照から動画, テキストから動画
- 時間
- 4 to 15 秒
- 比率
- 16:9, 4:3, 1:1, 3:4, 9:16, 21:9
- 出力
- 480p, 720p, 1080p, 4k
- ネイティブ音声
- 対応
適する場面
- テキスト、画像、動画、音声を柔軟な制作入口として使えます。
- 短尺、動き、カメラ、ネイティブ音声のバランスが実用的です。
- Genflow の主要モデルはテキスト、キーフレーム、参照動画生成に対応します。
確認が必要な点
- 公式には複数人物の一貫性、文字、複雑な編集、まれな音声歪みに制約があると記載されています。
- Fast と Mini は主要モデルより生成方法と解像度が限定されます。
Seedance 2.0
実用例
短い商品動画
商品動作、雰囲気、声、カメラを一つの短編にまとめます。
参照型広告コンセプト
15秒の企画に映像、動き、絵コンテ、音の資料を組み合わせます。
高速なクリエイティブ検証
速度を優先する場合は Genflow の Fast または Mini を使います。
FAQ
よくある質問
Seedance 2.0 とは何ですか?
ByteDance Seed のマルチモーダル音声動画モデルで、テキスト、画像、音声、動画を参照できます。
Seedance 2.0 と 2.5 の違いは?
2.5 は1回の生成が15秒から30秒に伸び、参照素材の数と制御性が強化されています。2.0 は短い制作で扱いやすく、Genflow では入口が多い点が特徴です。
Genflow に Fast と Mini はありますか?
はい。主要モデルに加えて Fast と Mini がありますが、生成方法と出力設定は少なくなります。
公式情報
このページの情報は以下の公式資料で確認しています。