模型

Google DeepMind 视频模型 · Google DeepMind

Veo 3.1 模型指南:电影感画面与原生音频

从电影感、指令遵循、原生音频和实际输出参数评估 Veo 3.1。

在 Genflow 中尝试最近审核: 2026年9月1日
Veo 3.1 workflow context
Genflow 工作流示意,仅用于说明使用场景,不代表模型基准测试结果。

先说结论

Veo 3.1 是 Google DeepMind 的视频生成模型,支持文生视频、图生视频和原生音频。Google 重点强调真实感、指令遵循、创意控制,以及对白、环境声和音效生成。

什么时候选择它

当电影感、指令遵循和同步原生音频比单次长时长更重要时,优先考虑 Veo 3.1。

模型官方事实

官方资料怎么说

只呈现厂商官方记录的能力,并与 Genflow 产品参数分开。

文生与图生视频

Google 将文生视频和图生视频都列为 Veo 3.1 的核心任务。

原生音频

可随视频生成对白、环境声和音效。

创意控制

官方资料提到参考图、首尾帧、镜头控制、续写和对象插入。

Genflow

Genflow 当前支持

以下参数直接读取当前 Genflow 模型配置。

生成方式
首尾帧生视频, 文生视频
时长
4, 6, 8 秒
画幅
16:9, 9:16
输出
720p, 1080p
原生音频
支持

适用方向

  • 适合强调真实运动和电影感的镜头。
  • 原生对白、环境声与音效可减少单独配音步骤。
  • Genflow 同时提供标准版与 Fast 版。

需要审核

  • Genflow 当前为固定短时长,较长叙事仍需多片段工作流。
  • 原生音频仍要审核发音、节奏、品牌安全和版权。

Veo 3.1

实际使用场景

电影感商品镜头

围绕灯光、镜头、运动和声音制作高完成度主视觉片段。

对白概念片

在正式制作前快速验证带对白的场景。

图片转视频

在保留核心构图的前提下,让确认过的主视觉动起来。

FAQ

创作者常问的问题

Veo 3.1 可以生成音频吗?

可以。Google 说明 Veo 可随视频原生生成对白、音效和环境声。

Genflow 的 Veo 3.1 支持哪些时长?

Genflow 当前为 Veo 3.1 与 Fast 版提供 4 秒、6 秒和 8 秒。

Veo 3.1 适合图片转视频吗?

适合。图生视频是 Veo 的核心能力之一,Genflow 也开放了基于关键帧的视频生成入口。

官方一手资料

本页事实均根据以下官方模型资料审核。