结论:AI 视频从"能生成"走向"可导演"

8 月 27 日,Google 发布 Gemini Omni 1.1 Flash(Google 官方博客、GenAI Daily 等多家媒体确认)。这是一次面向开发者的视频生成与编辑模型更新,核心不再追求更长的单段时长,而是把"可控性"和"可预期的成本"放到前台:场景可向后延展至 40 秒、支持首帧/尾帧控制、提供 360p 草稿到 4K 输出的分层定价。对需要稳定产出的企业内容团队来说,这意味着 AI 视频开始具备进入生产管线的条件。

从"生成"到"导演":控制力是这次重点

过去文生视频模型最大的痛点是"不可控"——同一段提示词每次结果都不同,角色长着长着就变了样。Omni 1.1 Flash 改动了几处关键能力:

  • 场景延展:模型在续写一段视频时,会参考此前最多 10 秒的画面(旧版只看最后 1 秒),以 10 秒为步长向后拼接,累计可至 40 秒,角色与运镜的一致性明显提升。
  • 首尾帧控制:开发者提供起始帧与结束帧两张图,模型补全中间的运动过程,适合做环绕镜头、推拉镜头等需要精确构图的镜头。
  • 参考片段:可附带最长 3 秒的参考视频,帮助跨镜头保持人物或场景外观一致。

每条生成的视频都带有 SynthID 隐形水印,便于事后识别是否为 AI 生成内容,这对企业合规发布是必要的基础能力。

价格分层:先草稿试错,再为成片付费

Google 给出四档按秒计费(综合 Google 官方定价与多家媒体报道):

分辨率单价(约)典型用途
360p 草稿$0.03 / 秒快速验证创意与运镜
720p 标准$0.10 / 秒社媒短片与常规交付
1080p$0.15 / 秒客户评审与营销剪辑
4K(超分)$0.30 / 秒最终成片交付

这种模式很像传统影视的"代理剪辑":团队先用极低成本在 360p 把分镜和节奏跑通,确定要用的镜头后再花真金白银做高清输出。一段 40 秒成片若全程用草稿,成本可控制在 1–2 美元量级。

对企业内容生产意味着什么

深圳市奇摩计算机有限公司,我们长期服务线下转线上的企业客户,一个普遍痛点是:营销与培训内容需求大、但专业视频产能不足。当 Gemini Omni 1.1 Flash 这类模型把"草稿—精修—成片"的成本结构摆清楚,企业就有机会把短视频、产品讲解、培训切片的内容生产,下沉到日常运营团队,而不必每次都外包。

像 WorkBuddy 这样的企业 AI 办公平台,正在把视频、文档、表格等生成能力封装成可编排的工作流——运营人员用自然语言描述分镜,系统调用模型批量出草稿,人工只做精选与终审。AI 视频从"实验室玩具"变为"可纳入流程的零件",关键就在于这种可控、可计价的工程化能力。

如果您的团队也在评估把 AI 视频纳入内容生产线,欢迎通过 奇摩官网咨询服务 与我们交流落地路径。