文字生成影片 vs 圖片生成影片,到底該怎麼選
先說結論:這不是二選一,是分工問題
先把結論放前面:糾結文字生成影片和圖片生成影片哪個更好,本身就問錯了問題。這兩者根本不是競品關係,是同一條生產鏈上的兩道工序——文字生成影片負責從零打造世界,圖片生成影片負責把已經確定的世界繼續演下去。真正該問的問題是:這個專案裡,哪一步該用哪一種。
控制力差異:文字生成影片賭運氣,圖片生成影片給錨點
文字生成影片的輸入只有文字,模型要同時決定構圖、光線、主體長相、鏡頭運動——自由度最高,但也意味著對最終畫面的控制力最低,同一句提示詞跑十次,人物長相都可能不一樣。這對需要角色反覆出場的專案是災難。
圖片生成影片反過來:給定一張參考圖作為起點,模型的任務收窄成讓這張圖動起來,主體外觀、構圖基本被鎖定,操心的只剩動作和鏡頭運動。控制力的代價是前期多了一道準備圖片的工序,而且參考圖品質直接決定成片下限——參考圖本身構圖彆扭、光線奇怪,影片生成模型不會幫你糾正,只會把這些問題原樣動畫化。
不同模型在圖生影片這塊的表現差異也不小:Wan 3.0 對參考圖的還原度評價很高,基本所見即所得;MiniMax H3 在圖生影片人物一致性上口碑不錯;Veo 3.1 新增的首尾幀和多參考圖控制,某種程度上是把圖生影片的控制力優勢也搬進了敘事連貫性更強的場景裡。
一致性問題的根源,以及怎麼根治
一致性幾乎是所有創作者抱怨最多的問題——上一個鏡頭的角色,下一個鏡頭換了張臉。根源其實很簡單:純文字生成影片的每一次生成都是獨立取樣,模型沒有跨鏡頭記憶,以為在拍同一個角色,模型眼裡是兩次完全獨立的任務。
碰運氣式的解決辦法是反覆重跑,拚人品,這不是根治,是自我安慰。真正根治的思路有兩條:
- 錨定一張主體參考圖,後續所有鏡頭都用同一張圖做圖生影片的起點,而不是每個鏡頭都重新文字生成再挑一張像的。
- 用支援參考圖/角色一致性功能的模型,比如 Runway Gen-4 的References、Veo 3.1 的多參考圖、Vidu Q3 的角色加道具加場景同框參考,這些功能設計的初衷就是解決一致性,比純提示詞描述外貌可靠得多。
說到底,一致性問題不是提示詞寫得不夠細就能解決的,是工作流程層面就該規劃好——先定角色參考圖,再圍繞它做所有後續生成。
參考圖從哪來
接下來是個挺現實的問題:參考圖從哪來?
選項無非三種。一是自己拍或找現成素材圖,勝在真實但受限於手頭有什麼;二是找設計師出圖,品質有保障但週期和成本都上去了;三是直接用AI圖像工具現生成一張,這條路這兩年跑通得很快。專案趕時間的時候會開個 PixPix 出參考圖——構圖和光線在文字生成圖片階段就能反覆調整確認,確認滿意了再拿去做圖生影片,比直接在影片模型裡連續抽卡省素材成本,也省時間。
選哪種取決於專案對真實感的要求:紀實類內容還是得用真實照片打底,風格化敘事內容用AI生圖當參考圖基本沒問題,而且能反過來控制風格統一——同一套AI生圖的畫風參數,批量出多張參考圖,比東拼西湊找素材圖更容易保證風格一致。
什麼時候必須用文字生成影片
圖生影片再香,也有它搆不到的場景。
- 需要憑空建構一個不存在的場景或生物,沒有參考圖可用,只能從文字直接生成。
- 強調鏡頭運動本身作為敘事手段(比如長鏡頭運鏡穿越多個空間),圖生影片鎖死了起始構圖,反而限制了這類大範圍運鏡的自由度。
- 物理模擬類內容(碰撞、流體、爆炸),Sora 2 這類擅長物理的模型,文字生成影片直接描述物理行為往往比找參考圖更直接。
- 早期創意探索階段,還沒確定視覺方向的時候,文字生成影片的高自由度反而是優勢,能幫忙快速看到幾種不同的可能性。
混合工作流程:首尾幀+文字生成影片續接的實作路徑
實際專案裡,老練的做法從來不是非此即彼,而是首尾幀加文字生成影片續接的混合流程。
具體做法:先用文字生成影片或AI生圖確定第一個關鍵幀和最後一個關鍵幀的畫面,把這兩幀作為圖生影片的首尾幀輸入(支援這個功能的模型如Veo 3.1),讓模型生成中間的過渡動畫;如果單段時長不夠,把這段的最後一幀截出來當作下一段的起始圖,再文字生成加圖生結合續寫下一段,像接力一樣把短片段拼成長敘事。
Kling 3.0 的延長機制、Veo 3.1 的Flow場景擴展,本質上都是在把這套接力邏輯產品化,不用自己手動截幀銜接。
按模型選路線的速查表
偷懶的話記這幾條就夠:
- 要角色反覆出場、跨鏡頭一致性優先——圖生影片起步,選 Wan 3.0、MiniMax H3 或帶參考圖功能的 Runway Gen-4。
- 要憑空造世界、物理效果炸裂——文字生成影片,首選 Sora 2 或 Seedance 2.5。
- 要帶對白和聲音的敘事短片——文字生成影片起步,Veo 3.1 的多參考圖能力可以在後續鏡頭裡補一致性。
- 要長敘事分鐘級短劇——混合流程,Kling 3.0 的延長機制目前最成熟。
