LNKLING

2026 年 8 月 12 日约 12 分钟

五个近期视频模型

视频模型正在变成一间工作室

最近的视频模型不再只竞争“生成一个好看的片段”。从 Seedance 的 30 秒 one-take,到 Veo 的原生音频,再到 Gemini Omni 的多轮对话编辑,视频生成正在被写成一整套制作方式。

下面对照五个模型的定位、时长、声音与工作方式,帮助你先判断自己需要的是导演、合成还是编辑能力。

从片段生成,到制作系统

如果只把这些系统理解为“文生视频”,会漏掉真正重要的变化。Seedance 2.5 把单次生成拉到 30 秒并允许再延展;Veo 3.1 用 “Video, meet audio” 把声音写进镜头;Gemini Omni 把创作与修改收成对话;MiniMax H3 试图用一个 omni-modal 上下文统一任务;Kling Video 3.0 则把 15 秒、原生音频、多镜头和商业一致性写成产品目标。

差异首先是工作方式差异。选择之前,最好先问:你是在导演一段连续段落,在生成一条带声音的短片,在用素材多轮修改,还是在组织图像、视频与音频参考。

导演。更长的一次生成与参考控制,让动作、镜头和声音能在同一段落里被安排。

合成。画面、对白、环境声和音效开始在同一次生成中成立。

编辑。视频可以继承上下文,用自然语言多轮修改,而不必每次从零重抽。

快速比较

模型定位时长声音工作方式
Seedance 2.5One-take direction单次最长 30 秒;可再延展两次音视频联合生成多模态参考、时间戳编辑、白模与绿幕
Veo 3.1Audiovisual realism支持延展;具体上限以产品入口为准原生音频(对白、环境声、音乐与音效)Gemini 与 Google Flow 中的视频生成
Gemini OmniConversational editingGemini 概览写明可创建约 10 秒视频原生音频生成文字 / 图 / 视频多轮对话编辑
MiniMax H3Multimodal creation官方用例面向短视频生成(页内展示 2K 与立体声)原生立体声统一多模态上下文理解与生成
Kling Video 3.0Commercial short-form production最长 15 秒原生音频与角色级口型同步多镜头叙事、元素一致性、多语言口型

Seedance 2.5

ByteDance Seed · One-take direction

ByteDance Seed 官网把 Seedance 2.5 定义为“下一代音视频联合生成模型”,面向最长 30 秒的叙事、精确参考控制和可编辑能力。发布文章进一步把它概括为 one-take creation:从“生成一个片段”转向“完成一件创作”。

时长。单次最长 30 秒;可再延展两次

声音。音视频联合生成

工作方式。多模态参考、时间戳编辑、白模与绿幕

产品页写明:单次生成最长 30 秒,并可再延展两次,以支撑更完整的叙事;运动更平滑、画面更写实。发布文章补充,模型在 15 秒基础上把单次生成拉长到 30 秒,并支持多轮延展,从而在更长视频里组织起承转合,而不是只把一个瞬间拉长。

参考与编辑是另一条主线。官网强调更精准地理解参考视频的意图、构图与电影语言;发布文章给出可操作上限:单次最多 30 张图、10 段视频、10 段音频,并强化 clay render、运动参考与创意参考。编辑侧则提供时间戳级音视频修改,以及绿幕、镜头视角和基于参考的编辑。

面向专业制作,产品页点名 white-model control、green-screen editing,以及专业运镜与表演调度。发布文章称模型已在即梦 AI、豆包 Pro 等入口上线。本文只记录这些官方公开表述,不做独立实测。

能力要点:单次生成最长 30 秒,并可再延展两次(产品页);音视频联合生成;发布文章称支持多轮延展与更完整叙事;单次最多 30 图 / 10 视频 / 10 音频参考(发布文章);时间戳编辑、白模控制、绿幕与运镜编辑(产品页与发布文章)。

相关链接:产品页、发布文章。

Veo 3.1

Google DeepMind · Audiovisual realism

DeepMind 的 Veo 页面用一句话定调:“Video, meet audio.” Veo 3.1 被定位为面向电影作者与故事讲述者的领先视频生成模型,把声音与画面放在同一套生成能力里。

时长。支持延展;具体上限以产品入口为准

声音。原生音频(对白、环境声、音乐与音效)

工作方式。Gemini 与 Google Flow 中的视频生成

官方能力叙事集中在三点:更强的真实感与物理一致性、更稳的提示遵循,以及覆盖音频的创意控制。DeepMind 展示的示例提示会同时写景别、人物动作、城市环境声、hip-hop 节拍和一句对白——声音不是后期附加,而是提示与生成的一部分。

产品入口方面,DeepMind 页面引导用户在 Gemini 与 Google Flow 中试用。前者适合直接对话生成,后者更侧重镜头组织与连续创作,创作者可以按项目复杂度选择入口。

与只输出无声短片的模型相比,Veo 3.1 的官方差异在于音画一体:对白、环境声和节奏可以与镜头一起成立。具体时长、分辨率与地区可用性以各入口当前说明为准,本文不补充未在上述页面写明的统一上限。

能力要点:DeepMind 定位:面向电影作者与故事讲述者的领先视频模型;强调原生音频、物理真实感、提示遵循与创意控制;创作入口包括 Gemini 与 Google Flow;官方示例将环境声、音乐与对白写入同一提示。

相关链接:Google DeepMind。

Gemini Omni

Google DeepMind · Conversational editing

Gemini 与 Google Blog 把 Gemini Omni 写成“像对话一样创作与编辑视频”。它不是又一个一句话出片的入口,而是把多模态输入和多轮修改收进同一条创作链路。

时长。Gemini 概览写明可创建约 10 秒视频

声音。原生音频生成

工作方式。文字 / 图 / 视频多轮对话编辑

Gemini 视频生成概览写明:可创建约 10 秒视频、原生音频、最多 5 张照片转视频、video-to-video 编辑与 multi-turn editing;在 Gemini app 中,Omni 将替换此前的 Veo 3.1 路径。DeepMind 页面补充:从任意输入创建内容(先从视频开始),并用自然语言逐步编辑,每一步建立在上一步之上。

Google Blog 介绍首个模型 Gemini Omni Flash,并已进入 Gemini app、Google Flow 与 YouTube Shorts。它接受图像、音频、视频和文字组合输入,生成结果被描述为 grounded in Gemini’s real-world knowledge;编辑时角色一致性、物理关系与场景记忆被反复强调。

因此官方卖点首先是交互方式:替换背景、改服装、调光线、换角色,都可以用对话继续,而不必每次从零重抽。本文只依据上述官方页面记录能力,不把演示片等同于统一基准测试。

能力要点:Gemini 概览:约 10 秒视频、原生音频、最多 5 张照片转视频;支持 video-to-video 与 multi-turn editing;可组合文字、图像、音频与视频作为输入;已进入 Gemini app、Google Flow 与 YouTube Shorts(Google Blog)。

相关链接:Gemini 概览、Google DeepMind、Google 博客。

MiniMax H3

MiniMax · Multimodal creation

MiniMax 的 H3 研究页把模型写成统一的多模态创作工具:用自然语言描述文字、图像、视频和音频之间的关系,再基于这些素材生成带原生立体声的视频,并展示 2K 输出。

时长。官方用例面向短视频生成(页内展示 2K 与立体声)

声音。原生立体声

工作方式。统一多模态上下文理解与生成

官方示例很直接:参考一段视频的 Hitchcock 运镜,让一张图片中的角色演唱,再让人声对齐另一段音频。使用者只需说明素材之间的关系,不必把每一种参考拆成不同操作。

以往工具常把图生视频、首尾帧、主体、运动、声音参考与编辑分成不同流程;H3 想把它们收进同一个创作上下文。多镜头、声音与画面,以及用自然语言提出的参考和修改,都可以在同一条工作流中延续。

页面同时突出 2K 输出与原生立体声,并给出片头、产品展示、动态海报和广告等用例。对创作者而言,重点是不同类型的素材能否被放在一起理解和使用。

能力要点:统一理解文字、图像、视频与音频上下文(官方研究页);展示 2K 输出与原生立体声;用自然语言描述多模态参考关系,而非固定任务表单;适合片头、产品展示、动态海报与广告等组合素材场景。

相关链接:MiniMax 研究页。

Kling Video 3.0

Kuaishou · Commercial short-form production

Kling 产品页把 Video 3.0 写成专业电影化短片工具:原生音频、多镜头叙事、角色一致性,以及面向广告与多语言营销的口型同步。Omni 用户指南则把它升级为“多模态输入 + 声音驱动角色 + 直接音画输出 + 分镜控制”。

时长。最长 15 秒

声音。原生音频与角色级口型同步

工作方式。多镜头叙事、元素一致性、多语言口型

产品页列明可做之事:多镜头动态运镜的电影短片、多语言与口音的本地化广告、单次最长 15 秒的高保真连续动作。新增能力强调 cinematic audiovisual synergy、元素与角色一致性,以及 15 秒序列中的 native text rendering,适合广告、产品演示与商业内容。

VIDEO 3.0 Omni 指南对比 O1:文本/图生视频支持原生音频与 multi-shot;新增 video element reference 与 element voice control;时长从最长 10 秒提升到 15 秒。模型把图像、视频、元素和文字都当作提示,并在复杂群戏中锁定多个主体特征。

官网还把 cinema-grade native 4K 作为系列能力展示。对交付型短片来说,官方重点不是单帧奇观,而是人物稳定、口型准确、文字可读和镜头连续。本文能力描述均来自 Kling 产品页与 Omni 用户指南。

能力要点:单次生成最长 15 秒;Omni 指南写明由 10 秒提升至 15 秒;原生音频与角色级口型同步;支持多人说话与多语言营销;多镜头叙事、元素/角色一致性、video element 与 voice control(Omni);产品页强调 native text rendering 与 cinema-grade native 4K。

相关链接:用户指南、产品页。

先选择工作方式

01

要一次生成更完整的连续段落,并做参考与时间戳编辑

Seedance 2.5
02

声音、对白和画面需要在同一次生成里同时可信

Veo 3.1
03

从现有素材出发,用自然语言多轮修改

Gemini Omni
04

要组合图像、视频与音频参考,并输出 2K 和原生立体声

MiniMax H3
05

制作商业短片、多镜头人物内容或多语言口型广告

Kling Video 3.0

各模型的能力、可用地区、价格和产品入口会持续变化,请以厂商当前页面为准。

延伸阅读

想进一步了解某个模型,可从这些厂商页面继续阅读。

回到开头 ↑
  1. 01Seedance 2.5
  2. 02Veo 3.1
  3. 03Gemini Omni
  4. 04MiniMax H3
  5. 05Kling Video 3.0