首頁專題指南 › AI影片提示詞怎麼寫:從時間軸分鏡到模型方言

AI影片提示詞怎麼寫:從時間軸分鏡到模型方言

一套能落地的寫法,不是玄學咒語

為什麼時間軸分鏡現在最值錢

三個月前還有人跟我爭,寫AI影片提示詞就是把想法用自然語言堆出來,模型夠聰明自己會理解。現在還這麼想的人,片子基本上卡在5秒就崩,鏡頭一多主體就飄掉。

真正的分水嶺是時間軸式分鏡寫法出現之後。把一段提示詞按 00:00-00:05、00:05-00:10 這樣切成時間段,每段只描述這段裡發生的動作、鏡頭運動和構圖,模型的執行精準度會有肉眼可見的提升。原因很直接:影片生成模型本質上是在對一段連續的時序訊號做條件約束,你給的條件顆粒度越細、越有時間錨點,它偏題的機率就越低。

這套寫法不是憑空歸納出來的,是從 Seedance 2.5 的官方案例和一批中國導演型創作者的實測裡反覆驗證出來的。Seedance 2.5 對多鏡頭腳本的理解力目前是第一梯隊,很大程度就是因為它對時間軸結構的提示詞吃得特別透。反過來說,如果還在用一整段話描述30秒的內容,不管換哪個模型,大概率都是在賭運氣。

時間軸格式怎麼寫

一個可用的時間軸提示詞長這樣:

關鍵不是格式好不好看,是每一段只塞一個動作意圖。很多人喜歡把緩緩推進、同時人物轉身、同時光線變化全部塞進一段裡,結果模型只能選一兩個執行,剩下的全丟。寧可多切一段,也別讓單段承擔超過一個運動指令。

時長怎麼切也有講究:5秒左右的短片段,建議每2-3秒切一個時間塊;10秒以上的,可以按3-4秒切。太碎(每秒切一段)反而會讓模型在段與段之間的銜接處顯得生硬,能明顯看出接口感。

鏡頭語言詞彙表

中文行話對照表,直接抄進提示詞裡就能用。

景別:遠景/全景/中景/近景/特寫/大特寫——從環境到臉部細節依序收緊,寫清楚能大幅減少人物比例失控的問題。

運鏡:推(dolly in)/拉(dolly out)/搖(pan)/移(track)/升降(crane)/手持跟拍(handheld follow)/環繞(orbit)。中國模型對中文運鏡詞的反應通常比翻譯腔的英文描述更準確。

光線:逆光剪影、側光輪廓光、頂光壓迫感、柔光散射、丁達爾效應——光線詞彙往往比「電影感」這種空泛形容詞有效十倍。

節奏:慢動作/正常速度/快剪——建議直接標註倍速或幀率傾向,比如0.5倍速慢動作特寫。

把這些詞按景別加運鏡加光線加節奏四件套組合寫,基本上能涵蓋九成常規鏡頭需求。

負面提示詞不是萬能但不能沒有

負面提示詞(negative prompt)的作用被很多人高估,也被很多人低估。高估的表現是指望靠它修正構圖錯誤——負面詞對構圖跑偏基本上沒用,那是正向描述該解決的問題。低估的表現是完全不寫,結果模型自由發揮出一堆你根本沒要的元素。

負面提示詞真正好用的場景是排除已知的模型癖好,比如:

不同模型對負面提示詞的支援程度不一樣,像 Sora 2 目前沒有公開API,負面詞的效果更依賴介面裡的設定,而不是純文字堆疊。寫之前最好先看一下具體模型的輸入規範,別把一套負面詞範本套用到所有平台上。

JSON/YAML結構化提示詞該什麼時候用

結構化提示詞(用JSON或YAML把鏡頭、主體、動作、鏡頭參數分欄位寫清楚)在兩種情境下值得用:一是需要批量生產、靠腳本自動拼接提示詞的工作流程,結構化欄位方便程式讀取替換;二是需要精確控制多個獨立參數(比如同時指定畫面比例、鏡頭時長、運鏡類型)且目標模型的API明確支援結構化輸入。

但如果是單條創作,手動寫一條10秒短片的提示詞,套JSON純屬浪費時間——模型內部還是要把結構化欄位轉回自然語言去理解,自己寫自然語言反而更直接,還能保留語感上的微調空間。真正決定效果的從來不是格式是JSON還是白話文,而是有沒有把鏡頭拆解到位。

一個簡單的判斷標準:如果提示詞需要被程式化生成或重複使用(比如批量測試同一分鏡換不同主體),就上結構化;如果是一次性精修,寫白話就夠了。

模型方言:Seedance吃中文分鏡,Veo吃對白,Sora吃物理描述

這是最容易被忽略、卻決定成片品質上限的一點:同一套提示詞思路,換個模型可能完全跑偏,因為每家模型的訓練資料側重不同,形成了各自的方言。

Seedance 2.5 / Seedance 2.0:對中文時間軸分鏡的理解力最強,武俠、國風、多鏡頭敘事這類題材,直接用中文寫詳細分鏡,執行精準度比翻成英文再餵進去更高。

Veo 3 / Veo 3.1:核心優勢是原生音訊,提示詞裡必須把對白內容、語氣、環境音寫清楚,單純堆鏡頭運動描述會浪費掉它最強的能力項目。寫法上更接近寫劇本台詞,而不是寫分鏡表。

Sora 2:物理模擬是強項,提示詞裡描述物體的重量、材質、碰撞方式、流體行為會比描述鏡頭語言更有效,它對「這顆球會怎麼彈」這類物理細節的反應,比對電影感鏡頭敏感得多。

Kling 3.0:運鏡參數化程度高,適合直接寫推拉搖移的具體幅度和速度,動作打鬥類內容尤其吃這套。

同一個分鏡腳本,給Seedance寫成中文分鏡清單,給Veo改寫成帶對白的場景劇本,給Sora換成物理動作描述,出片品質的差距會非常明顯。

三個可以直接抄的提示詞範例

範例一(中文分鏡,適配Seedance系):

[00:00-00:03] 中景,一名身著靛藍長衫的女子在竹林中緩步前行,側光透過竹葉形成斑駁光斑,風吹動衣袂與竹葉同步擺動

[00:03-00:06] 鏡頭緩慢推進至近景,女子轉身回眸,髮絲隨風揚起,背景虛化加深

[00:06-00:08] 特寫定格於女子眼神,光線由側光轉為逆光剪影,收尾

負面提示詞:多餘人物、畫面浮水印、過度平滑皮膚

範例二(對白劇本,適配Veo系):

場景:清晨廚房,窗外陽光斜射進來。一位中年男子一邊煎蛋一邊回頭對鏡頭外的孩子說:今天不准遲到,校車七點半就開了。語氣帶點無奈的笑意,背景有煎蛋滋滋聲與遠處電視新聞的模糊人聲。鏡頭固定機位,輕微手持晃動感。

範例三(物理動作,適配Sora系):

一顆玻璃彈珠從一公尺高的木質斜坡頂端滾落,途中撞擊三個骨牌依序倒下,最後一塊骨牌推倒一個裝滿水的塑膠杯,水花四濺到桌面反光,全程一鏡到底,固定俯視機位,正常速度。

這三條可以直接抄去改主體和場景,骨架不用動。

延伸閱讀

模型百科模型對比2026年AI影片生成到底多少錢一條AI影片的浮水印與版權,創作者躲不掉的一2026年免費AI影片工具盤點:誰的免費口型同步與數位人影片,怎麼挑才不會翻車多鏡頭AI短片工作流程:從一張腳本到一條文字生成影片 vs 圖片生成影片,到底該2026年9月AI影片模型分級榜
發現AI · AI影片案例與提示詞 — 編輯核對於 2026-09,價格與功能以官方為準。