AI影片提示詞怎麼寫:從時間軸分鏡到模型方言
為什麼時間軸分鏡現在最值錢
三個月前還有人跟我爭,寫AI影片提示詞就是把想法用自然語言堆出來,模型夠聰明自己會理解。現在還這麼想的人,片子基本上卡在5秒就崩,鏡頭一多主體就飄掉。
真正的分水嶺是時間軸式分鏡寫法出現之後。把一段提示詞按 00:00-00:05、00:05-00:10 這樣切成時間段,每段只描述這段裡發生的動作、鏡頭運動和構圖,模型的執行精準度會有肉眼可見的提升。原因很直接:影片生成模型本質上是在對一段連續的時序訊號做條件約束,你給的條件顆粒度越細、越有時間錨點,它偏題的機率就越低。
這套寫法不是憑空歸納出來的,是從 Seedance 2.5 的官方案例和一批中國導演型創作者的實測裡反覆驗證出來的。Seedance 2.5 對多鏡頭腳本的理解力目前是第一梯隊,很大程度就是因為它對時間軸結構的提示詞吃得特別透。反過來說,如果還在用一整段話描述30秒的內容,不管換哪個模型,大概率都是在賭運氣。
時間軸格式怎麼寫
一個可用的時間軸提示詞長這樣:
- [00:00-00:03] 鏡頭/主體/動作/環境的核心描述
- [00:03-00:06] 鏡頭運動方式變化,或主體動作的下一拍
- [00:06-00:08] 收尾鏡頭,通常給一個強調細節的特寫
關鍵不是格式好不好看,是每一段只塞一個動作意圖。很多人喜歡把緩緩推進、同時人物轉身、同時光線變化全部塞進一段裡,結果模型只能選一兩個執行,剩下的全丟。寧可多切一段,也別讓單段承擔超過一個運動指令。
時長怎麼切也有講究:5秒左右的短片段,建議每2-3秒切一個時間塊;10秒以上的,可以按3-4秒切。太碎(每秒切一段)反而會讓模型在段與段之間的銜接處顯得生硬,能明顯看出接口感。
鏡頭語言詞彙表
中文行話對照表,直接抄進提示詞裡就能用。
景別:遠景/全景/中景/近景/特寫/大特寫——從環境到臉部細節依序收緊,寫清楚能大幅減少人物比例失控的問題。
運鏡:推(dolly in)/拉(dolly out)/搖(pan)/移(track)/升降(crane)/手持跟拍(handheld follow)/環繞(orbit)。中國模型對中文運鏡詞的反應通常比翻譯腔的英文描述更準確。
光線:逆光剪影、側光輪廓光、頂光壓迫感、柔光散射、丁達爾效應——光線詞彙往往比「電影感」這種空泛形容詞有效十倍。
節奏:慢動作/正常速度/快剪——建議直接標註倍速或幀率傾向,比如0.5倍速慢動作特寫。
把這些詞按景別加運鏡加光線加節奏四件套組合寫,基本上能涵蓋九成常規鏡頭需求。
負面提示詞不是萬能但不能沒有
負面提示詞(negative prompt)的作用被很多人高估,也被很多人低估。高估的表現是指望靠它修正構圖錯誤——負面詞對構圖跑偏基本上沒用,那是正向描述該解決的問題。低估的表現是完全不寫,結果模型自由發揮出一堆你根本沒要的元素。
負面提示詞真正好用的場景是排除已知的模型癖好,比如:
- 排除多餘肢體、多餘人物(多主體場景的老大難問題)
- 排除畫面自帶浮水印/字幕(部分模型即使沒要求也會加上)
- 排除過度平滑的塑膠感皮膚
- 排除鏡頭晃動過量(如果要的是穩定運鏡)
不同模型對負面提示詞的支援程度不一樣,像 Sora 2 目前沒有公開API,負面詞的效果更依賴介面裡的設定,而不是純文字堆疊。寫之前最好先看一下具體模型的輸入規範,別把一套負面詞範本套用到所有平台上。
JSON/YAML結構化提示詞該什麼時候用
結構化提示詞(用JSON或YAML把鏡頭、主體、動作、鏡頭參數分欄位寫清楚)在兩種情境下值得用:一是需要批量生產、靠腳本自動拼接提示詞的工作流程,結構化欄位方便程式讀取替換;二是需要精確控制多個獨立參數(比如同時指定畫面比例、鏡頭時長、運鏡類型)且目標模型的API明確支援結構化輸入。
但如果是單條創作,手動寫一條10秒短片的提示詞,套JSON純屬浪費時間——模型內部還是要把結構化欄位轉回自然語言去理解,自己寫自然語言反而更直接,還能保留語感上的微調空間。真正決定效果的從來不是格式是JSON還是白話文,而是有沒有把鏡頭拆解到位。
一個簡單的判斷標準:如果提示詞需要被程式化生成或重複使用(比如批量測試同一分鏡換不同主體),就上結構化;如果是一次性精修,寫白話就夠了。
模型方言:Seedance吃中文分鏡,Veo吃對白,Sora吃物理描述
這是最容易被忽略、卻決定成片品質上限的一點:同一套提示詞思路,換個模型可能完全跑偏,因為每家模型的訓練資料側重不同,形成了各自的方言。
Seedance 2.5 / Seedance 2.0:對中文時間軸分鏡的理解力最強,武俠、國風、多鏡頭敘事這類題材,直接用中文寫詳細分鏡,執行精準度比翻成英文再餵進去更高。
Veo 3 / Veo 3.1:核心優勢是原生音訊,提示詞裡必須把對白內容、語氣、環境音寫清楚,單純堆鏡頭運動描述會浪費掉它最強的能力項目。寫法上更接近寫劇本台詞,而不是寫分鏡表。
Sora 2:物理模擬是強項,提示詞裡描述物體的重量、材質、碰撞方式、流體行為會比描述鏡頭語言更有效,它對「這顆球會怎麼彈」這類物理細節的反應,比對電影感鏡頭敏感得多。
Kling 3.0:運鏡參數化程度高,適合直接寫推拉搖移的具體幅度和速度,動作打鬥類內容尤其吃這套。
同一個分鏡腳本,給Seedance寫成中文分鏡清單,給Veo改寫成帶對白的場景劇本,給Sora換成物理動作描述,出片品質的差距會非常明顯。
三個可以直接抄的提示詞範例
範例一(中文分鏡,適配Seedance系):
[00:00-00:03] 中景,一名身著靛藍長衫的女子在竹林中緩步前行,側光透過竹葉形成斑駁光斑,風吹動衣袂與竹葉同步擺動
[00:03-00:06] 鏡頭緩慢推進至近景,女子轉身回眸,髮絲隨風揚起,背景虛化加深
[00:06-00:08] 特寫定格於女子眼神,光線由側光轉為逆光剪影,收尾
負面提示詞:多餘人物、畫面浮水印、過度平滑皮膚
範例二(對白劇本,適配Veo系):
場景:清晨廚房,窗外陽光斜射進來。一位中年男子一邊煎蛋一邊回頭對鏡頭外的孩子說:今天不准遲到,校車七點半就開了。語氣帶點無奈的笑意,背景有煎蛋滋滋聲與遠處電視新聞的模糊人聲。鏡頭固定機位,輕微手持晃動感。
範例三(物理動作,適配Sora系):
一顆玻璃彈珠從一公尺高的木質斜坡頂端滾落,途中撞擊三個骨牌依序倒下,最後一塊骨牌推倒一個裝滿水的塑膠杯,水花四濺到桌面反光,全程一鏡到底,固定俯視機位,正常速度。
這三條可以直接抄去改主體和場景,骨架不用動。
