AI動画プロンプトの書き方:タイムライン絵コンテからモデルの方言まで
なぜ今、タイムライン絵コンテが一番「効く」のか
3ヶ月前まで、AI動画のプロンプトなんて自然言語でアイデアを積み上げれば十分、モデルが賢ければ勝手に理解してくれる、と言い張る人がまだいました。今もそう思っている人の動画は、だいたい5秒あたりで破綻し、カットが増えるとすぐ被写体がブレていきます。
本当の分岐点になったのは、タイムライン形式の絵コンテが登場してからです。ひとつのプロンプトを00:00-00:05、00:05-00:10というように時間帯で区切り、各区間ではその区間内で起きるアクション・カメラワーク・構図だけを書く。これだけで、モデルの実行精度は目に見えて上がります。理由はシンプルで、動画生成モデルは本質的に連続した時系列信号に条件づけをしているだけなので、与える条件の粒度が細かく、時間的なアンカーがはっきりしているほど、脱線する確率は下がるわけです。
これは何となく思いついた話ではなく、Seedance 2.5の公式サンプルや、中国のディレクター気質のクリエイターたちの実地検証から繰り返し裏付けられてきた方法論です。Seedance 2.5のマルチカット脚本の理解力は現状トップクラスですが、その理由の大部分は、タイムライン構造のプロンプトの読み込みが異様にうまいから。逆に言えば、いまだに30秒分の内容を一つの長い段落で書いているなら、どのモデルを使おうと、それはほぼ運任せです。
タイムライン形式、実際の書き方
実際に使えるタイムラインプロンプトはこんな感じです。
- [00:00-00:03] カット/被写体/アクション/環境の核となる描写
- [00:03-00:06] カメラワークの変化、または被写体アクションの次のビート
- [00:06-00:08] 締めのカット。だいたいディテールを強調するクローズアップ
大事なのは見た目のきれいさではなく、各区間に詰め込むアクションの意図をひとつに絞ることです。よくあるのが、ゆっくり寄る・同時に人物が振り返る・同時に光が変わる、を全部一区間に詰め込んでしまうパターン。これをやるとモデルはどれか1〜2個しか実行してくれず、残りは切り捨てられます。ひとつの区間に複数の動きの指示を背負わせるくらいなら、区切りを増やしたほうがいいです。
長さの切り方にもコツがあります。5秒前後の短いクリップなら2〜3秒ごとに時間ブロックを切るのがおすすめ。10秒を超えるなら3〜4秒刻みでも大丈夫です。逆に細かく切りすぎる(毎秒ごとに区切る)と、区間同士のつなぎ目がぎこちなくなり、継ぎ目感がはっきり見えてしまいます。
カメラワーク用語集
中国語のカメラ用語対応表です。そのままプロンプトに突っ込んで使えます。
ショットサイズ:ロングショット/フルショット/ミディアムショット/クローズアップ/エクストリームクローズアップ——環境から顔のディテールへと段階的に寄っていく順番です。ここをきちんと書くだけで、人物の比率がおかしくなる問題がかなり減ります。
カメラワーク:プッシュイン(dolly in)/プルアウト(dolly out)/パン(pan)/トラック(track)/クレーン(crane)/ハンドヘルドフォロー(handheld follow)/オービット(orbit)。中国系のモデルは、翻訳調の英語表現より、中国語のカメラワーク用語に対する反応の方が総じて正確です。
ライティング:逆光シルエット、サイドライトによるリムライト、圧迫感のあるトップライト、拡散した柔らかい光、チンダル現象(木漏れ日の光線)——ライティング用語は「シネマティック」のような漠然とした形容詞より10倍効きます。
テンポ:スローモーション/通常速度/クイックカット——倍速やフレームレートの傾向を直接指定するのがおすすめです。例えば「0.5倍速のスローモーションクローズアップ」のように。
この、ショットサイズ+カメラワーク+ライティング+テンポの4点セットを組み合わせて書けば、通常のカット要件の9割はカバーできます。
ネガティブプロンプトは万能じゃないけど、なしでは済まされない
ネガティブプロンプトの役割は、過大評価されている面もあれば過小評価されている面もあります。過大評価されているのは、構図のミスまで直してくれると期待するケース——構図がズレる問題にネガティブプロンプトはほぼ無力で、それはポジティブ側の描写で解決すべき話です。過小評価されているのは、まったく書かずに済ませてしまうケース。結果としてモデルが自由に暴走し、頼んでもいない要素を大量に盛り込んできます。
ネガティブプロンプトが本当に効くのは、モデルの既知の「クセ」を排除する場面です。例えば、
- 余分な手足・余分な人物を排除(複数被写体のシーンで永遠の悩みどころ)
- 画面に自動で入る透かし・字幕を排除(一部モデルは頼まなくても入れてくる)
- 過度になめらかなプラスチック肌を排除
- 過剰なカメラブレを排除(安定したカメラワークが欲しい場合)
モデルによってネガティブプロンプトへの対応度は違います。例えばSora 2は現状公開APIがなく、ネガティブワードの効き方はテキストを積み上げることより、アプリ内インターフェースの設定に依存する部分が大きいです。書く前に、使うモデルの入力仕様をひと目確認しておいたほうがいいでしょう。ひとつのネガティブプロンプトのテンプレートを、全プラットフォームに使い回すのは避けたいところです。
JSON/YAML形式の構造化プロンプトはいつ使うべきか
構造化プロンプト(JSONやYAMLでカット・被写体・アクション・カメラパラメータをフィールドごとに分けて書く方法)が本当に役立つのは、次の2つの場面です。ひとつは、スクリプトでプロンプトを自動組み立てして量産するワークフローで、構造化フィールドならプログラムでの読み込み・置換がしやすいこと。もうひとつは、アスペクト比・カット尺・カメラワークの種類など複数の独立したパラメータを同時に精密制御したい場合で、かつ対象モデルのAPIが構造化入力を明確にサポートしている場合です。
でも、単発の制作——手作業で10秒の短いクリップのプロンプトを1本書くだけなら、JSONにする意味はほぼありません。どのみちモデルは内部で構造化フィールドを自然言語に変換し直して理解するので、最初から自然言語で書いたほうが直接的ですし、言葉のニュアンスを微調整する余地も残せます。結果を左右するのは、フォーマットがJSONか普通の文章かではなく、カットをきちんと分解できているかどうかです。
シンプルな判断基準としては、プロンプトがプログラム的に生成・再利用される必要がある(同じ絵コンテで被写体だけ変えてバッチテストする、など)なら構造化にする。一発仕上げの微調整なら、普通に言葉で書けば十分です。
モデルの「方言」:Seedanceは中国語の絵コンテ、Veoはセリフ、Soraは物理描写が得意
ここは見落とされがちですが、実は仕上がりの上限を決めてしまう重要なポイントです。同じプロンプトの発想でも、モデルを変えると完全に的外れになることがあります。各モデルの学習データの傾向が違うため、それぞれ独自の「方言」ができあがっているからです。
Seedance 2.5 / Seedance 2.0:中国語のタイムライン絵コンテへの理解力が最も強いモデルです。武侠もの、中華風、マルチカットの物語もの系のジャンルなら、詳細な絵コンテを中国語で直接書いたほうが、英語に翻訳してから渡すより実行精度が高くなります。
Veo 3 / Veo 3.1:一番のコアな強みはネイティブ音声です。プロンプトにはセリフの内容、トーン、環境音まできっちり書き込む必要があり、カメラワークの描写だけを積み上げると一番の強みを無駄にしてしまいます。書き方としては絵コンテ表というより、セリフ入りの脚本に近い感覚です。
Sora 2:物理シミュレーションが強みです。物体の重さ、質感、衝突の仕方、流体の挙動を描写したほうが、カメラ言語を描写するより効きます。「このボールがどう跳ねるか」のような物理ディテールへの反応は、シネマティックなカット表現より遥かに敏感です。
Kling 3.0:カメラワークのパラメータ化が進んでいて、プッシュ・プル・パン・トラックの具体的な幅と速度を直接指定するのに向いています。アクションや格闘系のコンテンツは特にこの書き方が効きます。
同じ絵コンテ脚本でも、Seedance向けには中国語のカットリストとして、Veo向けにはセリフ入りのシーン脚本として書き換え、Sora向けには物理アクションの描写に差し替える——これをやるだけで、出来上がる映像の品質差はかなりはっきり出ます。
そのままコピペできるプロンプト例3本
例1(中国語の絵コンテ、Seedance系向け):
[00:00-00:03] 中景,一名身着靛蓝长衫的女子在竹林中缓步前行,侧光透过竹叶形成斑驳光斑,风吹动衣袂与竹叶同步摆动
[00:03-00:06] 镜头缓慢推进至近景,女子转身回眸,发丝随风扬起,背景虚化加深
[00:06-00:08] 特写定格于女子眼神,光线由侧光转为逆光剪影,收尾
负面提示词:多余人物、画面水印、过度平滑皮肤
例2(セリフ入り脚本、Veo系向け):
场景:清晨厨房,窗外阳光斜射进来。一位中年男子一边煎蛋一边回头对镜头外的孩子说:今天不许迟到,校车七点半就走。语气带点无奈的笑意,背景有煎蛋滋滋声与远处电视新闻的模糊人声。镜头固定机位,轻微手持晃动感。
例3(物理アクション描写、Sora系向け):
一颗玻璃弹珠从一米高的木质斜坡顶端滚落,途中撞击三个多米诺骨牌依次倒下,最后一块骨牌推动一个装满水的塑料杯翻倒,水花四溅到桌面反光,全程一镜到底,固定俯视机位,正常速。
この3本はそのままコピーして、被写体とシーンだけ変えればOKです。骨格部分は触らなくて大丈夫です。
