Seedance 2.5 プロンプトガイド:構成、カメラ、タイミング、音声、参照
Seedance 2.5 のプロンプトの書き方を解説。基本の公式、カメラ用語、タイムスタンプ、セリフと効果音の書き方、参照の指定、動画編集、2.0 との違いまで。
Markdown で読む良い Seedance 2.5 のプロンプトは、誰が何をするのか、どこで、カメラがどう撮るのか、何が聞こえるのかを、この順番で伝えます。つまり、まず被写体と動作、次にシーン、ビジュアルスタイル、カメラ、音声です。長いクリップは「0-3s」のような時間範囲や番号付きのショットに分け、参照ファイルはすべて番号で呼び(「Image 1」「Video 1」)、長さ、アスペクト比、解像度はテキストではなくリクエストのパラメータで指定します。以下のルールは、ByteDance による Seedance 2.5 と 2.0 の公式プロンプトガイドに基づき、2026年9月29日に確認したものです。例として挙げるプロンプトはすべて本記事のために書き下ろしました。
Seedance 2.5 のプロンプトはどう書く?
ByteDance の基本の公式から始めます:「被写体 + 動作またはイベント + シーンと環境(任意)+ ビジュアルスタイル(任意)+ カメラの動き/カット(任意)+ 音声(任意)」。必須なのは最初の部分だけです。ガイドは被写体と動作を「動画の土台」と呼び、不要な部分は省いてかまわないとしています。
実際には、これが 4 つの短い文になります:
<Subject> performs <main action or event> in <scene and environment>.
The visuals feature <visual style>.
Use <shot size, camera angle, camera movement, or cuts>.
Audio includes <dialogue, ambience, sound effects, or music>.埋めた例:
A street baker pulls a tray of round loaves from a brick oven at night and sets it on a flour-dusted counter.
Warm orange light from the oven, visible steam, shallow depth of field, realistic film look.
Start with a close-up of the oven door opening, then pull back slowly to a medium shot of the counter.
Audio: crackling wood, the scrape of the metal tray, quiet street noise outside.違いを生む習慣が 3 つあります:
- 望まないことではなく、望むことを書く。 公式ガイドは「できる限り肯定的な記述」を求めており、否定の指示が使える場所として字幕と音声を挙げています(後述)。
- パラメータはプロンプトに入れない。 クリップの長さ、アスペクト比、解像度、音声を生成するかどうかはリクエストのフィールド(
duration、ratio、resolution、generate_audio)です。ガイドも、パラメータは「プロンプトに含める必要はない」としています。 - 最後に、変えてはいけないものを書く。 カメラアングル、舞台、雰囲気などを最後に書くと、クリップ全体を通して保たれます。
カメラとショットはどう指定する?
カメラ用語をそのまま書きます。ByteDance は、ショットサイズ(超ロング、ロング、ミディアム、ミディアムクローズアップ、クローズアップ)、動き(プッシュイン、プルアウト、パン、トラック、フォロー、オービット、ティルトアップ、手持ちの揺れ)、アングル(ローアングル、真上から、一人称視点)に加え、ワンショット/長回し、ドリーズーム、FPV、バレットタイム、スピードランプといった名前の付いた技法を挙げています。
あまり知られていない用語には、その後に平易な説明を添えます。ガイド自身の例は「ラックフォーカス:焦点がなめらかに移る。はじめは鮮明だった手前の木々がぼやけ、奥の人物が次第にはっきりしてくる。」です。
カットやトランジションでは、タイミングと方法の両方を書きます。たとえば「5 秒の時点で、左へ素早くウィップパンして次のシーンへ。」です。Seedance 2.0 のガイドには 2.5 でも役立つルールがあります。1 つのショットにつきカメラの動きは 1 つにすること。「プッシュ、プル、パン、移動を同時に」求めると、映像が不安定になるからです。
複数カメラのシーンは、番号付きのショットを並べ、それぞれにフレーミングを書くだけです:
Shot 1: Wide shot, locked-off camera, eye level. Two chess players sit across a table in an empty library.
Shot 2: Over-the-shoulder shot from behind the older player. The younger player moves a knight and looks up.
Shot 3: Close-up of the older player's hand hovering over the board, then tapping the table once.
Quiet room tone, the soft click of chess pieces, no music.Seedance はタイムスタンプに従う?
Seedance 2.5 は整数秒で従います。Seedance 2.0 は従いません。ByteDance の比較ははっきりしています:「Seedance 2.0 はタイムスタンプに反応せず、ショット番号にのみ反応しますが、Seedance 2.5 は整数秒のタイムスタンプに対応しています。」
2.5 では 3 つの書き方が使えます:
- 範囲: 「0-3s … 3-7s … 7-15s」のように、間に隙間を空けずに書きます。
- 時点: 「2 秒の時点で、突風がテーブルクロスを持ち上げる。」
- 相対的なタイミング: 「彼女はドアのそばで待つ。3 秒後、廊下の明かりが消える。」
与えた時間に合わせて内容の量を調整します。範囲の中で起きることが少なすぎるとモデルが即興で補い、多すぎると、ガイドの警告どおり結果が「カットが多すぎたり、プロットの一部が抜け落ちたりする可能性がある」ことになります。1 秒に 3 回首を振るような、速い反復動作にタイムスタンプを使うのは避けてください。
Seedance 2.5 の上限である 30 秒までのクリップは、各段階の終わりの状態を明確にした段階構成で書きます:
A lighthouse keeper's evening routine, realistic, cool blue dusk turning to night, no music.
0-6s: Wide shot of a lighthouse on a rocky coast at dusk. The keeper climbs the outside stairs with a lantern.
6-14s: Inside the lamp room, medium shot. He wipes the large lens with a cloth, then checks a brass gauge.
14-22s: Close-up of his hand turning a wheel. The main lamp starts to rotate and throws a beam across the room.
22-30s: Aerial shot pulling back from the tower. The beam sweeps over dark water. Waves and wind only.セリフ、効果音、字幕はどう書く?
Seedance 2.5 はデフォルトで動画と一緒に音声を生成します(generate_audio は true)。どれも普通の文で書けますが、音の種類を区別したいときのために、公式ガイドは括弧の使い分けを定めています:
| 内容 | 構文 | 例 |
|---|---|---|
| 音楽 | ( ) | (soft piano plays in the background) |
| 効果音 | < > | <a bell rings in the distance> |
| セリフ | { } | {Welcome back.} |
| 字幕 | 【 】 | 【Chapter One】 |
特定の言語やアクセントでセリフを話させるには、セリフの前にそれを明記します。ガイドの公式は Dialogue Language + Regional Variety or Accent + Delivery Style + Speaker + {Dialogue} で、たとえば Dialogue language: American English. The girl says in natural, conversational American English: {I thought you weren't coming.} のように書きます。ByteDance によると Seedance 2.5 は 10 以上の言語で音声をネイティブに生成しますが、ガイドには言語の一覧がないため、使う言語は自分で試してください。1 つのセリフの中で言語を混ぜないでください。2.0 のガイドが注意しているとおりで、固有名詞は例外です。
複数の登場人物が話す場合は、「登場人物のセリフ(感情):内容」の形で、1 行につき 1 回だけ話し方を書きます。ガイドによると、セリフの後で言葉を繰り返したり、個々の単語に口調や動作の注記を別々に付けたりすることが、モデルが字幕を加えてしまう原因の 1 つです。
ここでは否定の指示が効きます:「No subtitles」(字幕なし)、「No BGM; only ambient and action sounds」(BGM なし、環境音と動作音のみ)、「No audio.」(音声なし)。ByteDance によれば 2.0 より頻度は低いものの字幕が紛れ込むことはあり、字幕の入った参照動画は「no subtitles」を上書きしてしまうことがあります。既存の声や曲を登場人物に使わせるには、それを参照音声として添付し、その登場人物に結び付けます。ガイドの例では「画像 1 は主人公の John を描いており、音声 1 の声質を使用する。」としています。
プロンプトで画像・動画・音声を参照するには?
添付した順にすべてのファイルに番号を振り、テキストの中で結び付けます。ByteDance の例は次のとおりです:「画像 1〜2 は登場人物 1 で音声 1 に対応し、画像 3〜4 は登場人物 2 で音声 2 に対応する。」画像の中に書かれた名前に頼ってはいけません。ガイドによると、画像に「John」とラベルを付けたうえで「John is at school」と書くと、「登場人物の混同や重複を引き起こしやすい」とのことです。
各ファイルが何のためのものか、何を無視するかを書きます:
Image 1 defines the courier's face, hairstyle and yellow raincoat. Do not use the image background.
Image 2 defines the narrow alley, wet cobblestones and neon reflections. Do not use any people in it.
Video 1 defines the running pace and the handheld follow camera only.
The courier from Image 1 runs through the alley from Image 2 at night, jumps a puddle, and stops at a green door.参照動画がすでにその動きを正確に示しているなら、各ステップを書き直す代わりに「follow the actions and camera movement in Video 1」(Video 1 の動作とカメラの動きに従う)と書きます。書き直すと動画と矛盾することがあります。複数の画像が 1 つの物体を異なる角度から写している場合は、そう明記してください(「All four images show the same desk lamp; only one lamp appears」、つまり 4 枚とも同じデスクランプで、ランプは 1 つだけ登場する)。書かないと、モデルが別々の物体として扱うことがあります。
使う数の目安:Seedance 2.5 は画像を最大 30 枚、動画を 10 本、音声を 10 本受け付けます(動画と音声はそれぞれ合計最大 30 秒)。ByteDance は、被写体画像では 1〜8 体の被写体、動画や音声の参照では 1〜5 体の被写体でそれぞれ 5〜10 秒を推奨しています。それ以上も可能ですが、安定性は下がります。Seedance 2.0 は画像を最大 9 枚、動画を 3 本、音声を 3 本受け付け、そのガイドはファイルを合計 4〜5 個にすることを推奨しています。参照の種類ごとのリクエストの形は、画像・動画・音声の追加方法を参照してください。実在の人物の顔を含む参照画像や参照動画は拒否されます。エラーの内容と認められている方法はこちらの記事で説明しています。
動画の編集・延長はどうプロンプトを書く?
SeedRouter では、編集と延長は Seedance 2.5 の機能です。参照動画を 1 本送り、omni_reference_task_type を edit または extend に設定します。このとき、プロンプトには 2 つの役割があります。
編集では、範囲を示し、A から B への変化を書く。 add、remove、replace、change to のようなトリガーワードを入れ、部分的な編集には時間範囲を使います。ガイドの例は「Video 1 の 4〜6 秒で、男性の動作をコーヒーを飲むことから床をモップがけすることに変え、それ以外の内容は変えない。」です。物体の差し替えも同じパターンです:
Edit Video 1: replace the paper coffee cup on the desk with the green ceramic mug from Image 1. Keep the person, the camera and the audio unchanged.延長では、方向を示し、境界のフレームから書き始める。 「extend forward」(前方へ延長)、「extend backward」(後方へ延長)、「continue」(続ける)を使い、次に何が起きるかを書きます:
Continue Video 1: the cyclist reaches the top of the hill, stops, and takes off her helmet. The camera stays on the same side angle. Wind and distant birds.編集や延長では元の動画のアスペクト比が保たれるため、ratio は adaptive のままにします。編集では長さも保たれるため、duration は -1 にする必要があります。ByteDance は、色と音声の連続性を最良にするため、入力と出力の両方に MOV(output_format: "mov")を推奨しています。参照と編集を組み合わせたリクエストで結果が不安定になる場合、ガイドの解決策は、参照タスクと、その後の編集タスクに分けることです。リクエストボディそのものはクリップの編集・延長方法にあります。
絵コンテとキーフレームはどう使う?
役割が異なります。1 枚の画像に複数のコマを並べた絵コンテは、ゆるやかなストーリーの参考です。モデルはそれに「厳密には合わせない」とされています。一方、順番に添付した個別の画像であるキーフレームには、忠実に従います。
- 絵コンテ: 文字のないシンプルな線画や棒人間を使い、コマ数は 15 以下にします。まず絵コンテ画像を割り当て、1 行のストーリー概要を書き、そのあと各ショットを記述して、絵が示していないこと(動作、カメラ、スタイル)を補います。
- キーフレーム: 各フレームを個別の参照画像として添付し、プロンプトの冒頭に「Use Images 1 to 6 in order as keyframes.」(画像 1〜6 を順番にキーフレームとして使う)と書きます。
- 最初と最後のフレーム: 画像の role を
first_frameとlast_frameに設定します。これで出力は最初の画像のアスペクト比に固定されるため、アスペクト比が同じ 2 枚の画像を使ってください。reference_imageとして設定し「Image 1 is the first frame」と書いた場合、アスペクト比は固定されませんが、出力が画像と正確に一致しないことがあります。
Seedance 2.0 のプロンプトは何が違う?
構成は同じです(被写体、動作、シーン、カメラ、スタイル、音声)。ただし 2.0 のガイドは、2.5 では不要になったいくつかの点を求めています:
- 秒数ではなくショットで。 クリップを「Shot 1 / Shot 2 / Shot 3」のように組み立て、ペース配分はモデルに任せます。2.0 のガイドは正確なタイミング指定を「不安定」としています。
- 穏やかで連続した動き。 全力疾走、大きなジャンプ、激しい転がりよりも「ゆっくりと穏やかで、一貫した細かな動き」を好み、ある動作が次の動作へどうつながるかを書くよう求めています。
- 感情は動作で表す。 「very sad」(とても悲しい)ではなく、「lowers her head, shoulders trembling slightly, eyes reddening」(うつむき、肩がわずかに震え、目が赤くなる)と書きます。
- 登場人物 1 人につき顔のクローズアップ 1 枚と全身画像 1 枚。 多角度の設定画は、2.0 が複数の人物と解釈することがあるため使いません。Seedance 2.5 は多視点の画像を受け付けます。
- 同じ被写体は毎回同じ言い方で指す。 たとえば「the woman in the red coat@Image 1」(赤いコートの女性@Image 1)とするか、一度名前を定義して使い回します。
Seedance 2.0 のクリップは 4〜15 秒(デフォルトは 5 秒)で、同じリクエストを受け付ける Fast 版と Mini 版があり、こちらは 480p か 720p のみです。どのモデルを選ぶかは、バージョン比較と Seedance 2.0 vs Fast vs Mini ガイドで説明しています。ByteDance は、2 つのバージョンは「美的スタイルの好みが大きく異なる」とも注意しているため、同じプロンプトでも同じ見た目にはなりません。
Seedance がプロンプトどおりにならないのはなぜ?
失敗の多くは、公式 FAQ が挙げるいくつかの原因にたどり着きます:
- 短い時間に詰め込みすぎ。 出来事を分散させるか、
durationを長くします。 - 矛盾。 同じ登場人物についての 2 つの異なる記述や、動作とぶつかるカメラの動きです。
- 参照間で登場人物が入れ替わる。 登場人物が最初に現れる順に参照ファイルを添付し、プロンプトの番号をそれに合わせて振り直します。
- 目が光る。 「fanatical」(狂信的な)や「extremely shocked」(ひどく驚いた)のような強い言葉は、瞳を光らせることがあります。穏やかな言い回しにし、「normal human eyes; no glowing eyes」(普通の人間の目、光る目はなし)を加えます。
- 画面上の文字のつづり間違い。 単語を 1 文字ずつ書き出すか、正確な文字列を参照画像として渡します。
- 1 つのリクエストで多くをやりすぎ。 参照と編集を別々のタスクに分けます。
- 顔がブロックされる。 参照に含まれる実在の人物の顔は拒否されます。実在の人物エラーを参照してください。
下書きは 480p と短い duration で作り、残すバージョンを高い解像度でレンダリングします。失敗したタスクは課金されません。完成したクリップの費用は Seedance API 料金を参照してください。
よくある質問
Seedance のプロンプトは JSON で書くべきですか?
必須の形式はありません。ByteDance のガイドは、プロンプトは「すべて自然言語で書くことができる」としており、テンプレートはどれも普通の文に「Shot 1」や「0-3s」のような任意のラベルを付けたものです。構造は役立ちますが、JSON の構文は必要ありません。
Seedance 2.5 でアクションシーンを作るには?
戦いは大まかに記述し、細部は 1〜2 つの決め技に取っておきます。ガイドは、パンチを 1 発ずつ並べるより「双方が接近戦を繰り広げる」のような言い回しを推奨しています。見せ場をタイムラインに配置し、1 ショットにつきカメラの動きは 1 つにして、音は < > の効果音で記述します。
Seedance 2.5 の動画は最長何秒ですか?
1 リクエストあたり最長 30 秒で、duration で指定します(4〜30、またはモデルに任せる場合は -1)。Seedance 2.0 は最長 15 秒です。
Seedance の公式プロンプト最適化ツールはありますか?
あります。ByteDance は Seedance 2.5 用のプロンプトスキル sd25-pe を公開しており、コーディングアシスタントがこれを使って、送信前にプロンプトを書き直せます。インストールコマンドは公式ガイドに記載されています。
自分の写真を参照に使えますか?
いいえ。Seedance は実在の人物の顔を含む参照画像や参照動画を拒否します。ByteDance が代わりに認めている方法は、実在の人物エラーのガイドで説明しています。
プロンプトを試す
プロンプトを Seedance 2.5 プレイグラウンドか Seedance 2.0 プレイグラウンドに貼り付けるか、Seedance 2.5 API リファレンスを見ながらコードから送信してください。一度チャージするだけでサブスクリプションは不要、クレジットに有効期限はなく、失敗したタスクは課金されません。



