Gemini Omni Flash 发布:Google 推出首款支持对话式多轮编辑的视频模型

ADK happycapy官方 / ADK编译 2026-09-06 5 分钟 174 次浏览
速览导读 / Summary

Google DeepMind 正式发布 Gemini Omni Flash,作为其 Omni 模型家族的首个视频生成版本。该模型不仅支持 720p 视频与同步音频的一体化生成,更核心突破在于支持基于多轮对话的有状态视频编辑。开发者可通过 API 实现类似真人剪辑师的迭代工作流,显著降低社交内容制作与产品演示的门槛。

模型名称 Gemini Omni Flash Google DeepMind Omni 家族首个视频模型
输出分辨率 720p 支持 16:9、9:16、1:1 比例,时长 4-10 秒
编辑轮次上限 约 4 轮 超过此轮次可能出现角色一致性漂移
成本估算 约 $0.10/秒 显著低于 Veo 3.1 的 $0.40-$0.75/秒
API 状态 公开预览 模型字符串:gemini-omni-flash-preview

Key Insights / 核心看点

  • 1 支持基于多轮对话的有状态视频编辑,允许用户通过连续指令对视频进行增量修改,无需重新生成。
  • 2 原生集成同步音频生成能力,视频与声音在同一推理过程中完成,唇形同步精度极高。
  • 3 内置 AI Avatar 功能,支持通过人脸与语音样本生成高保真说话视频,适用于营销与本地化场景。
  • 4 相比竞品 Veo 3.1 成本更低(约 $0.10/秒),且具备独特的对话式交互体验,适合社交内容快速迭代。

Gemini Omni Flash:Google 重新定义视频生成的交互范式

2026 年 7 月,Google DeepMind 正式推出了 Gemini Omni Flash,这是其 Omni 模型家族中首个面向视频生成的“任意到任意”(any-to-any)多模态模型。与 OpenAI 将“Omni”定义为单一模型内的多模态感知不同,Google 的 Omni 架构旨在通过统一表示空间,原生处理任意输入模态(文本、图像、音频等)并生成任意输出模态。

Gemini Omni Flash 的核心杀手锏并非单纯的画质提升,而是其跨多轮对话的有状态视频编辑能力。它打破了传统视频生成工具“一次提示词对应一段片段”的线性模式,允许开发者通过连续对话对视频进行增量修改,仿佛在与一位智能剪辑师协作。

核心突破:对话式多轮编辑

Gemini Omni Flash 通过引入 previous_interaction_id 参数,实现了上下文感知的多轮交互。用户无需重新生成整个片段,只需下达修改指令(如更换场景、调整服装、改变镜头角度),模型即可在保留原有内容的基础上进行迭代。

  • 工作流示例:先生成一段咖啡馆场景,随后通过对话将其移至屋顶露台、拉远镜头并添加环境音,每一轮指令都基于上一轮的结果进行微调。
  • 编辑上限:目前模型能可靠保持约 4 轮的连贯性,第 5 轮后可能出现角色一致性漂移。建议策略为:先用 Veo 3.1 或 Seedance 2.0 生成高保真基础片段,再用 Omni Flash 进行精修。

差异化优势:同步音频与 AI Avatar

除了编辑能力,Gemini Omni Flash 在音频与角色生成上也具备独特优势:

  1. 原生同步音频:模型在推理过程中即生成同步音频,而非后期拼接。基于物理建模的声音模拟能精准匹配唇形与环境音,适用于 4-10 秒的片段。
  2. AI Avatar 功能:支持通过人脸参考图与语音样本生成照片级真实感的说话视频。该功能已获 Adobe Firefly 等企业采用,但严格遵循内容政策,禁止深度伪造及未经授权的肖像使用,并带有 SynthID 水印。

技术规格与竞品对比

特性 Gemini Omni Flash Veo 3.1 Seedance 2.0
分辨率 720p 最高 4K 最高 1080p
多轮编辑 支持 (有状态) 不支持 不支持
同步音频 支持 支持 不支持
AI Avatar 支持 不支持 不支持
成本 (约) $0.10/秒 $0.40-$0.75/秒 可变

尽管在动作物理效果上略逊于 Seedance 2.0,且分辨率上限为 720p,但 Omni Flash 在编辑灵活性与成本效率上(约为 Veo 的 1/4)展现出巨大潜力,特别适合短视频创作与快速原型设计。

开发者接入

Gemini Omni Flash 目前可通过 Gemini API(模型字符串:gemini-omni-flash-preview)及 Google AI Studio 调用。对于希望快速体验且无需配置 Google Cloud IAM 的开发者,Happycapy 提供了便捷的集成方案,支持与其他 150 多个模型进行对比测试。

“Gemini Omni Flash 的设计理念是:编辑视频应该感觉像是在和一位协作者对话,而不是每次想改动就重新提交一张工单。” —— Google DeepMind 团队

随着 Omni Pro 版本的规划,未来该架构有望支持更高分辨率与更长时长的生成,进一步重塑视频内容生产的工作流。

编辑视频应该感觉像是在和一位协作者对话,而不是每次想改动就重新提交一张工单。

Google DeepMind 团队

同主题深度资讯

查看更多 →
模型发布 2026-09-08

Framer AI 发布 CMS List Field:重构重复内容管理,赋能动态网站构建

Framer 于 2026 年 9 月正式发布 CMS List Field,彻底革新了重复内容(如 FAQ、产品特性)的管理方式。该更新引入原生列表字段,支持通过 Framer Agent 一键迁移旧数据,并优化了编辑器的内容复用与排序能力。此次更新不仅解决了垂直视频嵌入等长期存在的 Bug,还显著提升了大型 CMS 集合的滚动性能,为开发者提供了更强大的动态内容构建工具。

Framer AI官方 / ADK编译 4 分钟
模型发布 2026-09-08

Ajelix 自研 GPU 基础设施并推出企业级 Agentic 平台,解决数据主权与生产落地难题

Agentic AI 平台 Ajelix 宣布投资自建 GPU 计算基础设施,并正式发布面向企业的 Ajelix Enterprise Platform。此举旨在解决企业级 AI 落地中数据不可控、审计困难及中断风险等痛点。新平台提供从智能体编排、RAG 知识库到严格治理的全栈能力,支持私有化部署,助力企业将 AI 从实验阶段平稳过渡到生产运营。

Ajelix官方 / ADK编译 4 分钟
AI 工具 2026-09-08

DreamFace 发布 AI 直播生成器:零设备打造虚拟主播,重塑内容创作流程

DreamFace 正式推出 AI 直播生成功能,彻底消除传统直播对相机、灯光及推流软件的依赖。用户仅需上传照片或选择虚拟形象,配合脚本即可在数分钟内生成具备真实直播节奏与能量的视频。该工具支持游戏、带货、播客等多种模板,让创作者无需露脸即可测试新内容形式,大幅降低内容生产的门槛与试错成本。

DreamFace官方 / ADK编译 3 分钟
技术解读 2026-09-08

Accio Work 发布 F1 电视转播技术深度解析:8K 流媒体与超低延迟架构揭秘

Accio Work 深度编译 F1 TV 如何永久改变体育转播的历程,聚焦于日本市场策略、8K 流媒体技术革新及超低延迟架构。文章揭示了现代体育直播对带宽、编码及 CDN 的极致要求,包括 45% 的带宽消耗增长和亚 200ms 延迟标准。同时探讨了数字观众如何驱动 23 亿美元的周边销售,为开发者与架构师提供了从传统广播向数字化、智能化转型的宝贵案例与技术指标参考。

Accio Work官方 / ADK编译 3 分钟
agent · 免费+付费
★ 5.0 · 120评测
h

happycapy

Trickle 团队推出的云端 AI Agent 计算机

happycapy 是Trickle团队推出的基于Claude Code云端AI Agent原生计算机。happycapy 提供浏览器端的可视化桌面环境,让用户无需配置即可运行Claude Code和OpenClaw替代方案。happycapy 提供18万+Skill技能商店、Capy Mail邮件指令交互、自动化定时任务等功能。主打”让AI适应人而非人适应AI”,将命令行工具转化为直观的WYSIWYG图形界面,让普通用户通过对话能完成编程、写作、数据分析等复杂任务,真正实现开箱即用的AI生产力工具。

查看 happycapy 使用教程与功能