文生视频 vs 图生视频,到底该怎么选
先说结论:这不是二选一,是分工问题
先把结论放前面:纠结文生视频和图生视频哪个更好本身就问错了问题。这俩根本不是竞品关系,是同一条生产链上的两道工序——文生视频负责从零造世界,图生视频负责把已经确定的世界继续演下去。真正该问的问题是:这条项目里,哪一步该用哪种。
控制力差异:文生视频赌运气,图生视频给锚点
文生视频的输入只有文字,模型要同时决定构图、光线、主体长相、镜头运动——自由度最高,但也意味着对最终画面的控制力最低,同一句提示词跑十次,人物长相都可能不一样。这对需要角色反复出场的项目是灾难。
图生视频反过来:给定一张参考图作为起点,模型的任务收窄成让这张图动起来,主体外观、构图基本被锁定,操心的只剩动作和镜头运动。控制力的代价是前期多了一道准备图片的工序,而且垫图质量直接决定成片下限——垫图本身构图别扭、光线奇怪,视频生成模型不会帮你纠正,只会把这些问题原样动画化。
不同模型在图生视频这块的表现差异也不小:Wan 3.0 对垫图的还原度评价很高,基本所见即所得;MiniMax H3 在图生视频人物一致性上口碑不错;Veo 3.1 新增的首尾帧和多参考图控制,某种程度上是把图生视频的控制力优势也搬进了叙事连贯性更强的场景里。
一致性问题的根源,以及怎么根治
一致性几乎是所有创作者抱怨最多的问题——上一个镜头的角色,下一个镜头换了张脸。根源其实很简单:纯文生视频的每一次生成都是独立采样,模型没有跨镜头记忆,以为在拍同一个角色,模型眼里是两次完全独立的任务。
碰运气式的解决办法是反复重跑,拼人品,这不是根治,是自我安慰。真正根治的思路有两条:
- 锚定一张主体参考图,后续所有镜头都用同一张图做图生视频的起点,而不是每个镜头都重新文生视频再挑一张像的。
- 用支持参考图/角色一致性功能的模型,比如 Runway Gen-4 的References、Veo 3.1 的多参考图、Vidu Q3 的角色加道具加场景同框参考,这些功能设计的初衷就是解决一致性,比纯提示词描述外貌可靠得多。
说到底,一致性问题不是提示词写得不够细能解决的,是工作流层面就该规划好——先定角色参考图,再围绕它做所有后续生成。
垫图从哪来
接下来是个挺现实的问题:垫图从哪来?
选项无非三种。一是自己拍或找现成素材图,胜在真实但受限于手头有什么;二是找设计师出图,质量有保障但周期和成本都上去了;三是直接用AI图像工具现生成一张,这条路这两年跑通得很快。项目赶时间的时候会开个 PixPix 出垫图——构图和光线在文生图阶段就能反复调整确认,确认满意了再拿去做图生视频,比直接在视频模型里连续抽卡省素材成本,也省时间。
选哪种取决于项目对真实感的要求:纪实类内容还是得用真实照片打底,风格化叙事内容用AI生图当垫图基本没问题,而且能反过来控制风格统一——同一套AI生图的画风参数,批量出多张垫图,比东拼西凑找素材图更容易保证风格一致。
什么时候必须用文生视频
图生视频再香,也有它够不到的场景。
- 需要凭空构建一个不存在的场景或生物,没有参考图可用,只能从文字直接生成。
- 强调镜头运动本身作为叙事手段(比如长镜头运镜穿越多个空间),图生视频锁死了起始构图,反而限制了这类大范围运镜的自由度。
- 物理模拟类内容(碰撞、流体、爆炸),Sora 2 这类擅长物理的模型,文生视频直接描述物理行为往往比找垫图更直接。
- 早期创意探索阶段,还没确定视觉方向的时候,文生视频的高自由度反而是优势,能帮忙快速看到几种不同的可能性。
混合工作流:首尾帧+文生视频续接的实操路径
实际项目里,老练的做法从来不是非此即彼,而是首尾帧加文生视频续接的混合流程。
具体做法:先用文生视频或AI生图确定第一个关键帧和最后一个关键帧的画面,把这两帧作为图生视频的首尾帧输入(支持这个功能的模型如Veo 3.1),让模型生成中间的过渡动画;如果单段时长不够,把这段的最后一帧截出来当作下一段的起始图,再文生加图生结合续写下一段,像接力一样把短片段拼成长叙事。
Kling 3.0 的延长机制、Veo 3.1 的Flow场景扩展,本质上都是在把这套接力逻辑产品化,不用自己手动截帧衔接。
按模型选路线的速查表
偷懒的话记这几条就够:
- 要角色反复出场、跨镜头一致性优先——图生视频起步,选 Wan 3.0、MiniMax H3 或带参考图功能的 Runway Gen-4。
- 要凭空造世界、物理效果炸裂——文生视频,首选 Sora 2 或 Seedance 2.5。
- 要带对白和声音的叙事短片——文生视频起步,Veo 3.1 的多参考图能力可以在后续镜头里补一致性。
- 要长叙事分钟级短剧——混合流程,Kling 3.0 的延长机制目前最成熟。
