AI视频提示词怎么写:从时间轴分镜到模型方言
为什么时间轴分镜现在最值钱
三个月前还有人跟我争,写AI视频提示词就是把想法用自然语言堆出来,模型够聪明自己会理解。现在还这么想的人,片子基本卡在5秒就崩,镜头一多主体就飘。
真正的分水岭是时间轴式分镜写法出现之后。把一段提示词按 00:00-00:05、00:05-00:10 这样切成时间段,每段只描述这一段里发生的动作、镜头运动和构图,模型的执行精度会有肉眼可见的提升。原因很直接:视频生成模型本质上是在给一段连续的时序信号做条件约束,你给的条件颗粒度越细、越有时间锚点,它偏题的概率就越低。
这套写法不是凭空总结的,是从 Seedance 2.5 的官方案例和一批国内导演型创作者的实测里反复验证出来的。Seedance 2.5 对多镜头脚本的理解力目前是第一梯队,很大程度就是因为它对时间轴结构的提示词吃得特别透。反过来说,如果还在用一整段话描述30秒的内容,不管换哪个模型,大概率都是在赌运气。
时间轴格式怎么写
一个可用的时间轴提示词长这样:
- [00:00-00:03] 镜头/主体/动作/环境的核心描述
- [00:03-00:06] 镜头运动方式变化,或主体动作的下一拍
- [00:06-00:08] 收尾镜头,通常给一个强调细节的特写
关键不是格式好看,是每一段只塞一个动作意图。很多人喜欢把缓缓推进、同时人物转身、同时光线变化全部塞进一段里,结果模型只能选一两个执行,剩下的全丢。宁可多切一段,也别让单段承担超过一个运动指令。
时长切法也有讲究:5秒左右的短片段,建议每2-3秒切一个时间块;10秒以上的,可以按3-4秒切。太碎(每秒切一段)反而会让模型在段与段之间的衔接处生硬,能明显看出接口感。
镜头语言词汇表
中文黑话对照,直接抄进提示词里。
景别:远景/全景/中景/近景/特写/大特写——从环境到面部细节依次收紧,写清楚能大幅减少人物比例失控的问题。
运镜:推(dolly in)/拉(dolly out)/摇(pan)/移(track)/升降(crane)/手持跟拍(handheld follow)/环绕(orbit)。国内模型对中文运镜词的响应通常比翻译腔的英文描述更准。
光线:逆光剪影、侧光轮廓光、顶光压迫感、柔光散射、丁达尔效应——光线词汇往往比电影感这种空泛形容词有效十倍。
节奏:慢镜头/正常速/快切——建议直接标注倍速或帧率倾向,比如0.5倍速慢动作特写。
把这些词按景别加运镜加光线加节奏四件套组合写,基本能覆盖九成常规镜头需求。
负面提示词不是万能但不能没有
负面提示词(negative prompt)的作用被很多人高估也被很多人低估。高估的表现是指望靠它修正构图错误——负面词对构图跑偏基本无效,那是正向描述该解决的问题。低估的表现是完全不写,结果模型自由发挥出一堆你根本没要的元素。
负面提示词真正好用的场景是排除已知的模型癖好,比如:
- 排除多余肢体、多余人物(多主体场景的老大难)
- 排除画面自带水印/字幕(部分模型即使没要求也会加)
- 排除过度平滑的塑料感皮肤
- 排除镜头抖动过量(如果要的是稳定运镜)
不同模型对负面提示词的支持程度不一样,像 Sora 2 目前没有公开API,负面词的效果更依赖交互界面里的设置而不是纯文本堆砌。写之前最好先看一眼具体模型的输入规范,别把一套负面词模板套用到所有平台上。
JSON/YAML结构化提示词该什么时候上
结构化提示词(用JSON或YAML把镜头、主体、动作、镜头参数分字段写清楚)在两种场景下值得用:一是需要批量生产、靠脚本自动拼接提示词的工作流,结构化字段方便程序读取替换;二是需要精确控制多个独立参数(比如同时指定画幅比例、镜头时长、运镜类型)且目标模型的API明确支持结构化输入。
但如果是单条创作,手动写一条10秒短片的提示词,套JSON纯属浪费时间——模型内部还是要把结构化字段转回自然语言理解,自己写自然语言反而更直接,还能保留语感上的微调空间。真正决定效果的从来不是格式是JSON还是大白话,是有没有把镜头拆解到位。
一个简单判断标准:如果提示词需要被程序化生成或复用(比如批量测试同一分镜换不同主体),上结构化;如果是一次性精修,写人话就够。
模型方言:Seedance吃中文分镜,Veo吃对白,Sora吃物理描述
这是最容易被忽略、但决定成片质量上限的一点:同一套提示词思路,换个模型可能完全跑偏,因为每家模型的训练数据侧重不同,形成了各自的方言。
Seedance 2.5 / Seedance 2.0:对中文时间轴分镜的理解力最强,武侠、国风、多镜头叙事这类题材,直接用中文写详细分镜,执行精度比翻译成英文再喂进去更高。
Veo 3 / Veo 3.1:核心优势是原生音频,提示词里必须把对白内容、语气、环境音写清楚,单纯堆镜头运动描述会浪费它最强的能力项。写法上更接近写剧本台词而不是写分镜表。
Sora 2:物理模拟是强项,提示词里描述物体的重量、材质、碰撞方式、流体行为会比描述镜头语言更有效,它对这个球会怎么弹这类物理细节的响应比对电影感镜头敏感得多。
Kling 3.0:运镜参数化程度高,适合直接写推拉摇移的具体幅度和速度,动作打斗类内容尤其吃这套。
同一个分镜脚本,给Seedance写成中文分镜清单,给Veo改写成带对白的场景剧本,给Sora换成物理动作描述,出片质量差距会非常明显。
三个可以直接抄的提示词范例
范例一(中文分镜,适配Seedance系):
[00:00-00:03] 中景,一名身着靛蓝长衫的女子在竹林中缓步前行,侧光透过竹叶形成斑驳光斑,风吹动衣袂与竹叶同步摆动
[00:03-00:06] 镜头缓慢推进至近景,女子转身回眸,发丝随风扬起,背景虚化加深
[00:06-00:08] 特写定格于女子眼神,光线由侧光转为逆光剪影,收尾
负面提示词:多余人物、画面水印、过度平滑皮肤
范例二(对白剧本,适配Veo系):
场景:清晨厨房,窗外阳光斜射进来。一位中年男子一边煎蛋一边回头对镜头外的孩子说:今天不许迟到,校车七点半就走。语气带点无奈的笑意,背景有煎蛋滋滋声与远处电视新闻的模糊人声。镜头固定机位,轻微手持晃动感。
范例三(物理动作,适配Sora系):
一颗玻璃弹珠从一米高的木质斜坡顶端滚落,途中撞击三个多米诺骨牌依次倒下,最后一块骨牌推动一个装满水的塑料杯翻倒,水花四溅到桌面反光,全程一镜到底,固定俯视机位,正常速。
这三条可以直接抄去改主体和场景,骨架不用动。
