Seedance 3.0

Seedance 2.5

Create longer multimodal videos with Seedance 2.5

Seedance 2.5 is available in the generator with longer duration, expanded reference limits, and a familiar creation workflow.

Key points

4-30sDuration

Choose any whole-second duration from 4 to 30 seconds.

50Reference inputs

Use up to 30 images, 10 videos, and 10 audio references.

1080pMaximum output

Choose 480p, 720p, or 1080p for your project.

Highlights

  • Generate any whole-second duration from 4 to 30 seconds.
  • Use up to 30 images, 10 videos, and 10 audio references.
  • Choose 480p, 720p, or 1080p across six supported aspect ratios.
  • Seedance 2.5 does not support Creative Mode.

Seedance 2.5 guide

Seedance 2.5 公式プロンプトガイドおよびプロンプトテンプレート

字节跳动(バイトダンス)は次世代の動画生成モデル **Seedance 2.5** を発表しました。動画制作に携わる人にとって、今回変わったのは画質だけではありません。1本の動画にまるごと1シーンを収められ、1度に数十点もの参照素材を同時に扱え、動画を修正する際には秒単位で箇所を指定できます。

テキストのみでの生成に加え、画像・動画・音声を同時に参照しての創作や、既存動画の編集にも対応しています。

Seedance 2.5 の主な進化(2.0 との比較)

01 ナラティブの限界を突破:30秒動画を直接生成、高忠実度の時系列延長

  • 1本あたりの尺の上限が **30 秒** に拡大され、カットの表現がより連続的になり、後編集でのつなぎ合わせを必要とせず、感情の起伏とストーリーの展開を完結した形で表現できます
  • 高忠実度の時系列延長機能も備え、人物・シーン・カメラの一貫性を保ったまま、短い素材を自然に長い完成動画へと引き延ばせます
  • 特に、広告 TVC、ショートドラマ、ブランドストーリー動画など、ストーリーの完成度が求められるシーンに適しています

02 全モーダル参照の拡充:50点の全モーダル参照素材をアップロード可能

  • 1回の入力で使える素材の上限が **50 点** の全モーダル素材(画像/動画/音声を自由に組み合わせ可能)に引き上げられました
  • クリエイターは、キャラクター群・シーン群・参考カット・ブランド音楽をまとめて一度に与えられます
  • プロ向けの3Dホワイトモデル、商品パッケージ、ブランドVIなどの複雑度の高いアセットも、そのまま受け継いでくれます

03 正確な動画編集:プロ級の仕上がりで、創作の効率が大幅アップ

  • **動画の部分編集機能** を新設:全体の映像・カメラ・テンポを維持したまま、画面上の背景・商品・人物などの部分要素を精密に修正できます
  • これにより生成結果を修正・反復・納品でき、後編集での作り直しコストを圧縮します
  • 代表的なシーンとして、広告コンテンツのローカライズ、EC素材のSKU一括流用、ブランドコンテンツのマルチチャネル版制作などが挙げられます

04 10以上の言語をネイティブ対応、より強力な指示コントロール

  • **10以上の言語** をネイティブにサポートし、世界中のクリエイターが母語でクリエイティブ意図を記述できます
  • 指示の理解力と制御能力も同時に強化され、複雑なカメラワーク、感情の転換、多層的なシーン描写にもより正確に従えます

字节跳动(バイトダンス)は公式プロンプトガイドを公開しました。1文からの生成、50点の参照素材の使い分け方、30秒の長尺動画の区切り方、動画修正で一部だけを変更する方法まで、各タスクにそのまま使えるテンプレートが用意されています。

---

SECTION 01 | 基本のプロンプト作成技法

1.1 テキスト指示の基本公式

プロンプトは以下の公式に従って自由に組み合わせられます。

**FORMULA:主体 + 動作またはイベント + シーンと環境(任意)+ 視覚スタイル(任意)+ カメラワークまたはカット(任意)+ 音(任意)**

5つの成分がそれぞれ担う役割

| 成分 | 説明 |
|------|------|
| **主体 + 動作またはイベント** | 「誰(何)が」「何をしている」のかを説明します。動画内容の土台となる部分です。動作はまず主要なプロセスを大まかにまとめ、重要な動作だけに具体的な詳細を書き、同じ動作を重複して描写するのは避けます。 |
| **シーンと環境** | 場所、時間、天候、空間関係、背景の状態を説明します。 |
| **視覚スタイル** | 光、色彩、質感、映像の質感、または全体の雰囲気を説明します。 |
| **カメラワークまたはカット** | 画角、カメラ位置、カメラの動き、ピントを合わせる対象、カットのつなぎ方を説明します。 |
| **音** | セリフ、声質、環境音、効果音、音楽を説明します。 |

基本テンプレート

<主体>は<シーンと環境>で<主要な動作またはイベント>を行います。映像は<視覚スタイル>を呈します。カメラは<画角、カメラ位置、カメラワークまたはカット>を採用します。音には<セリフ、環境音、効果音または音楽>が含まれます。

陶芸家1人が早朝の工房で、水色の陶器のカップを完成させ、それをロクロから外して木棚の中央に置きます。窓の外から柔らかな朝の光が室内に差し込み、湿った陶土は繊細な光沢を放ち、作業台は整然としています。カメラはまず中景でろくろ挽きの動作をとらえ、次に陶器の表面の質感へとゆっくりと寄り、最後に木棚の正面へとカットします。ろくろの低い回転音、陶土がこすれる音、わずかな室内の環境音を残します。
**注意**:不要な部分は省略できます。生成パラメータはプロンプトに書く必要はありません。調整可能なパラメータは生成ページまたはAPIで設定します。

---

1.2 参照素材がある場合:まず素材を準備し、役割を明確にする

最大 **50 点** の参照素材を組み合わせて使用できます。

4種類の素材の入力範囲と推奨範囲

| 素材の種類 | 入力範囲 | 推奨範囲 |
|----------|----------|----------|
| **画像** | 最大30枚、1枚あたり4K以下 | 主体画像は1~8個の主体が目安 |
| **動画** | 最大10本、全動画の合計尺が30秒を超えないこと | 主体の動画は1~5個の主体、1本あたり5~10秒が目安 |
| **音声** | 最大10本、全音声の合計尺が30秒を超えないこと | タスクに直接関連するセリフ、声質、環境音、または音楽を残す |
| **動画編集** | 動画と参照画像を併用して編集できます | 元動画は20秒以内、参照画像は1~5枚が目安 |

**注意**:推奨範囲を超えても試せますが、素材が多いほど安定性が低下しやすくなります。
主体の画像に5個以上の主体が写っていて、さらに複数の視点が必要な場合は、視点ごとに別々の画像に分けることをおすすめします。複数の視点を1枚の画像に合成するよりも、独立した視点の画像を複数用意する方が一般的に安定します。

素材ごとに役割を説明する

参照素材をアップロードした後、各素材が具体的に何を提供するのかを説明する必要があります。素材内の人物・背景・構図が完成動画に誤って持ち込まれやすい場合は、何を採用しないかも明記します。

**素材の対応関係は必ずプロンプトに書き込みます**。画像内の文字ラベルだけに頼らず、複数の素材がそれぞれどの人物・道具・シーンに対応するかをモデルに任せてはいけません。

素材の役割テンプレート
@画像1は<主体>の<外見、服装、構造または材質>に使用します。
@動画1は<動作、カメラワークまたはリズム>に使用します。
@音声1は<キャラクターまたは音の種類>の<声質、セリフ、環境音または音楽>に使用します。
<主体>は<シーン>で<主要な動作またはイベント>を完了します。映像は<視覚スタイル>を呈し、カメラは<カメラ表現>を採用します。
@画像1は<陶芸家>の顔立ち、髪型、濃い緑色のエプロンに使用し、画像の背景は採用しません。@画像2は<陶芸工房>の木製作業台、窓の位置、朝の光に使用し、画像内の人物は採用しません。@動画1は両手でのろくろを挽く動作、陶器のカップを持ち上げる動作、置く動作のリズムに使用し、動画内の人物の身分、服装、シーンは採用しません。<陶芸家>は早朝の<陶芸工房>で水色の陶器のカップを完成させ、それをロクロから外して木棚の中央に置きます。カメラはまず中景でろくろ挽きの動作をとらえ、次に陶器表面の質感へとゆっくりと寄ります。ろくろの回転音、陶土のこすれる音、室内の環境音を残します。
複数視点の書き方
@画像1は同じ折りたたみ式デスクランプの正面の外観を定義します。@画像2は同じ折りたたみ式デスクランプの左側の構造を定義します。@画像3は同じ折りたたみ式デスクランプの右側の構造を定義します。@画像4は同じ折りたたみ式デスクランプの背面の構造を定義します。4枚の画像が共同で同じ折りたたみ式デスクランプを定義し、完成動画の中には常に折りたたみ式デスクランプが1台だけあります。
**ヒント**:参照動画がすでに動作、カメラワーク、順序を正確に示している場合は、プロンプトでは何を受け継ぐかを書くだけでよく、動作を1つずつ繰り返す必要はありません。重複した記述は素材自体と矛盾することがあります。

---

1.3 音と文字の特殊記号

プロンプトは自然言語をそのまま使用できます。音楽、効果音、セリフ、字幕をより細かく区別したい場合は、以下の特殊記号を使用できます。

| カテゴリ | 記号 | 例 |
|------|------|------|
| **音楽** | `· ( )` | `·(背景でゆったりとしたテンポのピアノ曲が流れる)` |
| **効果音** | `< >` | `<遠くから鐘の音が聞こえる>` |
| **セリフ** | `{ }` | `{こんにちは、おかえりなさい}` |
| **字幕** | `[ ]` | `[第一章:旅立ち]` |

字幕や音を制御したい場合は、残す音と採用しない音の種類をそのまま明記します。映像内容は引き続きポジティブな記述を優先し、素材の役割、編集範囲、誤って持ち込まれやすい内容だけを明確に制限します。

**例:**

  • 背景音楽なしで、人物のセリフ、環境音、動作の効果音だけを残す。
  • 字幕なし。
  • すべての音なし。

セリフの言語の指定強化

セリフが中国語でない場合は、セリフの前に言語を明確に記すことをおすすめします。

少女は日本語でそっと言います:{もう大丈夫です}

**推奨公式**:

セリフの言語 + 地域変種または方言アクセント + 話し方 + 話し手 + {セリフ内容}

**例**:

セリフの言語:アメリカ英語。少女が自然で口語的なアメリカ英語で言います:{I thought you weren't coming.}
セリフの言語:ネイティブなロサンゼルスのアメリカ英語。若い男性が自然なロサンゼルス風の口語で言います:{No way, you actually made it.}

---

SECTION 02 | 応用テクニック

2.1 マルチ素材の創作:各シーンで何を使うべきかをモデルに伝える

画像、動画、音声を組み合わせて使用できます。素材が多い場合、プロンプトの重点はすべての素材を同じ文に書き込むことではなく、人物、道具、シーン、動作、音の対応関係を明確にすることです。

以下の順序でまとめることをおすすめします。

**ORDER:素材ごとの役割 → 主体のマッピング → タイプ別にグループ化 → 主体の設定 → シーンごとに素材を呼び出し**

STEP 01 | 異なる主体ごとに名前を付ける

異なる人物、商品、道具はそれぞれ別の素材に紐づける必要があります。

`<人物A>は@画像1に対応し、外見、髪型、服装だけを採用します。<人物B>は@画像2に対応し、外見、髪型、服装だけを採用します。<道具A>は@画像3に対応し、構造、材質、色だけを採用します。<シーンA>は@画像4を参考にし、空間のレイアウト、建築、光だけを採用し、画像内の人物は採用しません。`
**「@画像1から@画像4がそれぞれ4人のキャラクターを定義する」と書かないでください**。この書き方では、どの画像がどのキャラクターに対応するのかが明確になりません。

STEP 02 | タイプ別に素材を整理する

[人物]<修復師>は@画像1に対応し、外見、髪型、服装だけを採用します。<記録係>は@画像2に対応し、外見、髪型、服装だけを採用します。<展示設営員>は@画像3に対応し、外見、髪型、服装だけを採用します。<解説員>は@画像4に対応し、外見、髪型、服装だけを採用します。4人の外見、服装、動作、立ち位置、セリフは互いに交換しません。

[道具]<標本ケース>は@画像5に対応し、<修復師>だけが所有します。<記録ボード>は@画像6に対応し、<記録係>だけが所有します。

[シーン]<修復室>は@画像7を参考にし、空間、材質、光だけを採用します。<展示ホール>は@画像8を参考にし、空間、材質、光だけを採用します。

[動作と音]@動画1は<修復師>が標本ケースを開ける動作に使用し、動画内の人物とシーンは採用しません。@音声1は<解説員>の声質と指定されたセリフに使用します。

STEP 03 | 重要な主体を重点的に記述する

同じ人物が複数のシーンにまたがって複数の素材を使用する場合は、主体の設定を追加できます。

[主体の設定:修復師]外見と服装:@画像1。固定の道具:@画像5の中の<標本ケース>。登場する場所:<修復室>と<展示ホール>。動作の参考:@動画1のケースを開ける動作、@動画2の標本を置く動作。採用しないもの:他の人物の服装、<記録ボード>や解説用の機器は持たない。

STEP 04 | シーンに応じて素材を呼び出す

**シーン1|修復室での点検** 使用するもの:<修復師>、<標本ケース>、<修復室>、@動画1のケースを開ける動作。イベント:<修復師>が作業台の前で標本ケースを開け、中の標本を確認します。終了時:<修復師>は作業台の内側で止まり、標本ケースは常に<修復師>自身の右手のそば、つまり画面の左側にあります。
**シーン2|展示ホールでの受付** 使用するもの:<記録係>、<記録ボード>、<展示ホール>。イベント:<記録係>が展示ケースのそばで記録ボードの番号を確認します。終了時:記録ボードは引き続き<記録係>が両手で持ち、他の人物は展示ケースのエリアに入りません。
**目標**:マルチ素材の創作の目標は、モデルが現在のシーンで正しい素材を選択できるようにすることで、すべての素材を同時に画面に出すことを求めるものではありません。

---

2.2 30秒の長尺動画:段階と終了状態でイベントを整理する

イベントが多い場合は、ストーリーを連続した段階に分割することをおすすめします。各段階には主要な状態変化を1つだけ配置し、その段階の終了時に画面で直接確認できる状態を明確に書きます。

長尺動画テンプレート

[生成目標]<動画の種類>の動画を1本生成します。核心となる主体は<主体>、主要なイベントは<ストーリーの概要>です。

[段階1]開始時:<人物、道具、シーンの初期状態>。主要なイベント:<主要な動作またはイベントを1つ>。終了時:<人物の位置、道具の所有、または画面の状態>。

[段階2]前の段階から引き継ぐ:<保持すべき状態>。主要なイベント:<主要な動作またはイベントを1つ>。終了時:<確認できる状態>。

[段階3]主要なイベント:<終了のイベント>。終了時:<最終的な画面の状態>。

[一貫性の保持]<人物の身分、人数、服装、道具の所有、空間の向き、音の関係>を安定して保ちます。

例:花屋の注文ラッピングの流れ

花屋の注文ラッピングの流れを説明する動画を生成します。<フラワーアーティスト>と<店員>が協力して、花束の整理、ラッピング、お渡しまでを完了します。
**段階1**
- 開始時:<フラワーアーティスト>が作業台の後ろに立ち、机の上にはほぐした花枝、ハサミ、ラッピングペーパーが置かれています。
- 主要なイベント:<フラワーアーティスト>が花枝を整理し、長さを整えます。
- 終了時:花束は<フラワーアーティスト>の左手に握られ、ハサミは作業台の右側に戻されています。
**段階2**
- 前の段階から引き継ぐ:2人は同じ身分と服装を保ち、花束は引き続き<フラワーアーティスト>が持ちます。
- 主要なイベント:<店員>がラッピングペーパーを広げ、<フラワーアーティスト>が花束を入れ、緑色のリボンを結びます。
- 終了時:ラッピングが完了した花束が作業台の中央に平らに置かれ、リボンの結び目がカメラの方を向いています。
**段階3**
- 主要なイベント:<店員>が花束を持ち上げ、受け取り棚に置きます。
- 終了時:花束は受け取り棚の中央にだけあり、2人は作業台の後方に立って完成品を確認しています。
**一貫性の保持**:<フラワーアーティスト>と<店員>の身分、服装、作業台の向き、ハサミの位置、花束の所有を安定して保ちます。

タイムスタンプとテンポの制御

通常のナラティブでは「段階」を優先して使用します。重要な受け渡し、出入り、トランジション、明確なビートの制御が必要な場合にのみ、1秒単位の時間表現を使用します。

  • **時間区間**はストーリーのテンポを割り当てるのに適しています
  • **時間点**は1つの重要なイベントを指定するのに適しています
  • **相対時間**はイベント同士の待機関係を記述するのに適しています

**例**:

0~5秒:空の木製ディスプレイ台を映します。1本の手が白い陶器の皿を置きます。終了時には手は離れており、ディスプレイ台の中央には白い陶器の皿だけがあります。
5~10秒:白い陶器の皿を片付け、次に透明なガラスのコップを置きます。終了時にはディスプレイ台の中央に透明なガラスのコップだけがあります。
10~15秒:透明なガラスのコップを片付け、次に緑色の陶器の瓶を置きます。終了時にはディスプレイ台の中央に緑色の陶器の瓶だけがあります。
**注意**:時間区間は連続し、重複しないようにします。時間区間はイベントの時間予算を示すもので、精密な編集ポイントではありません。動作は境界付近で前後することがあります。1つの時間区間の内容が少なすぎるとモデルの自由度が増し、多すぎるとカットのやりすぎやストーリーの抜け落ちを招くことがあります。
**タイムスタンプで「1秒間に3回の動作を完了する」といった頻度を制御しないでください。**

---

2.3 編集 / 先頭・末尾フレーム / 延長タスクのパラメータ規則

動画編集、先頭フレームまたは先頭・末尾フレームからの動画生成、動画延長では、入力素材に応じて一部の生成パラメータが自動的にロックされます。具体的な規則は以下の通りです。

| タスクの種類 | アスペクト比 | 尺(長さ) |
|----------|----------|------|
| **動画編集** | 入力動画の比率を自動で保持し、**別途設定はできません** | 入力動画の尺をほぼ自動で保持し、**別途設定はできません**。最大約0.3秒の差が生じることがあります |
| **先頭フレームまたは先頭・末尾フレームからの動画生成** | **先頭フレーム画像の比率**を自動的に使用します。先頭フレームと末尾フレームは同じアスペクト比にします | 設定可能 |
| **動画延長** | 入力動画の比率を自動で保持し、**別途設定はできません** | 設定可能 |

これらのタスクで自動的にロックされたパラメータは、生成ページまたはAPIで別途指定できません。その他のパラメータは現在利用可能なオプションに従います。

---

2.4 動画編集:マスタービデオ、修正範囲、保持内容を明確にする

既存動画を編集するときは、まず元動画を唯一のマスタービデオとして定義し、その上で編集対象、作用範囲、目標素材、保持内容を説明します。

一般的な編集の書き方

[編集目標]@動画1を編集し、<全編または明確な時間帯>で<画面の対象、領域、または音のカテゴリ>に対して<追加、削除、置換、または調整>を行います。

[元動画の役割]@動画1は唯一の編集マスタービデオであり、<人物、シーン、動作、構図、カメラ、オクルージョン(遮蔽)関係、音、イベントの順序>を担います。

[目標素材の役割]@画像1または@音声1は<目標の対象または音の指定された属性>に使用します。

[編集範囲]<対象、領域、時間帯、または音のカテゴリ>のみを処理します。

[保持内容]@動画1の中の<変化させてはいけない映像、動作、音、時間関係>を保持します。

[編集目標]@動画1を編集し、4~7秒の間だけ画面右側の壁の冷たい青い照明を暖かいオレンジ色の照明に調整します。
[元動画の役割]@動画1は唯一の編集マスタービデオであり、人物、部屋のレイアウト、動作、構図、カメラの動き、音、イベントの順序を担います。
[編集範囲]右側の壁面とその照らされた領域の光の色だけを調整します。人物の肌の色は環境光に合わせて自然に変化します。
[保持内容]人物の身分、服装、表情、位置、動作、部屋の構造、カメラの動き、セリフ、環境音は@動画1を保持します。

CASE A | 主体の置き換え

**テンプレート**:

[編集目標]@動画1を編集し、<元の対象>だけを<目標の対象>に変更します。

[元動画の役割]@動画1は唯一の編集マスタービデオであり、元のシーン、カメラ位置、カメラの動き、動作の軌跡、オクルージョン関係、イベントの順序を担います。

[目標素材の役割]@画像1は<目標の対象>の<外観、構造、または材質>に使用し、<無関係な背景、人物、または構図>は採用しません。

[編集の対象と範囲]<明確な対象と領域>だけを変更します。全編での目標の対象の数は<数量>です。<保持すべき内容>は変更しません。

[タイムラインの継承]<目標の対象>は、<元の対象>の出現・移動・遮蔽・退場のたびの時点、継続時間、経路、速度の変化を継承します。上記で明確に変更した対象または領域を除き、@動画1内の他の人物、道具、シーンの内容、カメラの動き、カメラの切り替え、イベントの順序は元のまま保持します。

**例**:

[編集目標]@動画1を編集し、動画内の黄色い折りたたみ式デスクランプだけを@画像1の白い折りたたみ式デスクランプに置き換えます。
[元動画の役割]@動画1は唯一の編集マスタービデオであり、机、本、手の動き、カメラ位置、カメラの動き、オクルージョン関係、イベントの順序を担います。
[目標素材の役割]@画像1は白い折りたたみ式デスクランプの外観、構造、材質だけに使用し、画像内の背景、構図、その他の物体は採用しません。
[編集の対象と範囲]全編を通して白い折りたたみ式デスクランプは常に1台だけです。元の黄色い折りたたみ式デスクランプだけを置き換え、本、机、手、背景は変更しません。
[タイムラインの継承]白い折りたたみ式デスクランプは、元の黄色い折りたたみ式デスクランプの出現・ライトアームの回転・手による遮蔽・画面外への退場のたびの時点、経路、速度の変化を継承します。上記で明確に変更した対象または領域を除き、@動画1内の他の人物、道具、シーンの内容、カメラの動き、カメラの切り替え、イベントの順序は元のまま保持します。

CASE B | 背景の置き換え

**テンプレート**:

[編集目標]@動画1を編集し、<元の背景領域>だけを@画像1の<目標の環境>に置き換えます。

[元動画の役割]@動画1は唯一の編集マスタービデオであり、人物、前景の物体、動作、構図、カメラの動き、イベントの順序を担います。

[目標素材の役割]@画像1は<目標の環境>の空間レイアウト、材質、被写界深度、環境色、光の方向だけに使用し、画像内の人物や前景の物体は採用しません。

[編集の対象と範囲]<主体の輪郭の外側の背景領域>だけを変更します。<主体の身分、顔立ち、髪型、服装、表情、位置、大きさ、動作>は変更しません。

[タイムラインの継承]人物の動作とオクルージョン関係は@動画1を保持します。上記で明確に変更した対象または領域を除き、@動画1内の他の人物、道具、シーンの内容、カメラの動き、カメラの切り替え、イベントの順序は元のまま保持します。

**例**:

@動画1は唯一の編集マスタービデオであり、人物、動作、構図、カメラ、イベントの順序を担います。@画像1は、昼間のガラス温室の空間レイアウト、被写界深度、環境色、光の方向だけを提供し、画像内の人物は採用しません。@動画1の中の人物の輪郭の外側にある薄いグレーの背景だけを、@画像1の昼間のガラス温室に置き換えます。人物の身分、顔立ち、髪型、服装、表情、位置、大きさ、手を上げる動作は@動画1を保持します。上記で明確に変更した対象または領域を除き、@動画1内の他の人物、道具、シーンの内容、カメラの動き、カメラの切り替え、イベントの順序は元のまま保持します。

音の編集

セリフ、言語、声質、背景音楽、効果音はそれぞれ別々に処理できます。プロンプトには、話し手または音のカテゴリ、目標とする変化、その他の音を保持するかどうかを明確に書く必要があります。

**例**:

@動画1を編集し、元の背景音楽だけを削除し、人物のセリフ、口元、環境音、動作の効果音を残します。映像内容、カメラ、編集のテンポは@動画1を保持します。
@動画1を編集し、<解説員>のセリフの言語を自然なアメリカ英語に調整します。セリフの内容と発話のタイミングは変えません。他の人物の声、背景音楽、環境音、映像は@動画1を保持します。

---

2.5 動画延長:まず境界の画面を揃え、その後に前置きまたは後続の内容を記述する

動画延長は、元動画の境界の外側で創作を続けることです。出力比率は自動的に入力動画の比率を保持し、延長する尺はユーザーが設定します。

2つの方向の境界画面

| 方向 | 境界の要件 |
|------|----------|
| **後方への延長** | 延長部分の最初の画面は、元動画の末尾フレームを引き継ぐ必要があります |
| **前方への延長** | 延長部分の最後の画面は、元動画の先頭フレームに接続する必要があります |

境界の画面に加えて、人物、道具、背景、運動の傾向、音も連続させます。

後方への延長

まず元動画の末尾フレームの連続状態を記述し、その後に末尾フレームの後で起こる内容を記述します。

**基本テンプレート**:

@動画1は後方に延長する必要のある元動画です。@動画1を後方に延長します。延長部分の最初の画面は@動画1の末尾フレームを直接引き継ぎます。<主体の姿勢と向き>、<道具の位置>、<背景と空間の関係>、<カメラ位置と構図>、<光>、<音の状態>、<運動の傾向>を連続させます。続いて、<延長が必要な新しい動作、イベント、カメラ、または音>を記述します。延長の過程では<人物の身分と服装>、<重要な道具>、<背景のレイアウト>、<撮影の軸線>、<元の音環境>を連続させます。同じ主体は常に同じ連続した対象であり続け、重複したり分裂したりしません。人物の外見や物体の部品の数は安定して保ちます。

**例**:

@動画1は後方に延長する必要のある元動画です。@動画1を後方に延長します。延長部分の最初の画面は@動画1の末尾フレームを直接引き継ぎます。同じ固定中景、オレンジ色の紙飛行機の位置と向き、教室の窓辺の背景、午後の光、画面右側へ飛んでいく傾向を連続させます。その後、オレンジ色の紙飛行機は画面右側へ滑空し続けて画面の外へ出ます。窓辺の白いシースルーのカーテンがわずかに揺れます。カメラと教室の背景は元動画の末尾フレームの状態を保持します。
後方への延長:他の参照素材がある場合

まず他の素材がそれぞれ何を担うかを1つずつ説明し、その上で元動画が延長の境界を担うことを明確にします。

**テンプレート**:

@画像1は<人物A>の顔の特徴を定義します。@画像2は<人物A>の服装を定義します。@画像3は<重要な道具>の構造と材質を定義します。@動画1は後方に延長する必要のある元動画です。@動画1を後方に延長します。延長部分の最初の画面は@動画1の末尾フレームを直接引き継ぎます。<境界の画面と音の状態>を連続させます。続いて、<人物Aが重要な道具を使って完了する新しい動作またはイベント>。延長の過程では<人物の身分と服装>、<重要な道具>、<背景のレイアウト>、<撮影の軸線>、<元の音環境>を連続させます。同じ主体は常に同じ連続した対象であり続け、重複したり分裂したりしません。人物の外見や物体の部品の数は安定して保ちます。

**例**:

@画像1は<園芸師>の顔の特徴を定義します。@画像2は<園芸師>の薄緑色の作業エプロンを定義します。@画像3は<籐編みの花かご>の構造と材質を定義します。@動画1は後方に延長する必要のある元動画です。@動画1を後方に延長します。延長部分の最初の画面は@動画1の末尾フレームを直接引き継ぎます。温室の作業台、<園芸師>の立ち位置、<籐編みの花かご>の位置を連続させます。続いて、<園芸師>は両手で<籐編みの花かご>を持ち上げ、背後の木棚の中段に置きます。延長の過程では<園芸師>の顔、エプロン、温室のレイアウト、カメラの方向を連続させます。

前方への延長

まず元動画の開始前に起こる内容を記述し、その上で元動画の先頭フレームを延長部分の明確な終了状態として記述します。

**基本テンプレート**:

@動画1は前方に延長する必要のある元動画です。@動画1を前方に延長します。元動画の開始前に、<前置きの動作、イベント、カメラ、または音>を記述します。延長部分の最後の画面は@動画1の先頭フレームに自然に接続します。<主体の姿勢と向き>、<道具の位置>、<背景と空間の関係>。<カメラ位置と構図>、<光>、<音の状態>、<運動の傾向>を@動画1の先頭フレームと一致させます。延長の過程では<人物の身分と服装>、<重要な道具>、<背景のレイアウト>、<撮影の軸線>、<元の音環境>を連続させます。同じ主体は常に同じ連続した対象であり続け、重複したり分裂したりしません。人物の外見や物体の部品の数は安定して保ちます。

**例**:

@動画1は前方に延長する必要のある元動画です。@動画1を前方に延長します。元動画の開始前に、同じガラス温室の空の映像を映します。朝霧が地面に沿ってゆっくりと広がり、上部の遮光カーテンが徐々に上がり、画面には一時的に人物がいません。延長部分の最後の画面は@動画1の先頭フレームに自然に接続します。温室の中央通路、両側の栽培台、ガラスの骨組み、柔らかな朝の光、固定された広角構図を@動画1の先頭フレームと一致させます。終了時には遮光カーテンが完全に上がり、通路には人物がおらず、葉がまだわずかに揺れています。
前方への延長:他の参照素材がある場合

素材の役割を1つずつ宣言し、どの素材を前方への延長部分で使用し、どの素材を元動画の開始後だけに使用するかを説明します。

**テンプレート**:

@画像1は<人物A>の顔の特徴を定義します。@画像2は<人物A>の服装を定義します。@画像3は<重要な道具>の構造と材質を定義します。@動画1は前方に延長する必要のある元動画です。@動画1を前方に延長します。元動画の開始前に、<人物Aが前置きの動作またはイベントを完了します>。延長部分の最後の画面は@動画1の先頭フレームに自然に接続します。<人物Aの姿勢と向き>、<重要な道具の位置と状態>、<他の人物の立ち位置>。<背景と空間の関係>、<カメラ位置と構図>、<光>、<音の状態>、<運動の傾向>を@動画1の先頭フレームと一致させます。延長の過程では<人物の身分と服装>、<重要な道具>、<背景のレイアウト>、<撮影の軸線>、<元の音環境>を連続させます。同じ主体は常に同じ連続した対象であり続け、重複したり分裂したりしません。人物の外見や物体の部品の数は安定して保ちます。<元動画の開始後にだけ現れる素材>は、前方への延長部分に先立って現れません。

**例**:

@画像1は<キュレーター>の顔の特徴を定義します。@画像2は<キュレーター>の濃紺色の作業コートを定義します。@画像3は<木製の展示ケース>の構造と材質を定義します。@画像4は2名の<展示設営アシスタント>のグレーの作業着を定義します。@画像5は<展示準備室>の空間と光を定義します。@動画1は前方に延長する必要のある元動画です。@動画1を前方に延長します。元動画の開始前に、<キュレーター>は作業台の前へ歩いて行き、閉じた<木製の展示ケース>を手に取り、ふたを開けます。延長部分の最後の画面は@動画1の先頭フレームに自然に接続します。<キュレーター>は画面の中央に立ち、開いた<木製の展示ケース>を両手で支えます。2名の<展示設営アシスタント>は、その背後に左右に1人ずつ立ちます。縦画面の正面中景、作業台の位置、準備室の背景、左側からの朝の光を@動画1の先頭フレームと一致させます。
**注意**:境界の画面は視覚的に自然に接続することを目指すもので、ピクセル単位で完全に同じであるべきではありません。
延長結果の音量は元動画とわずかに異なることがあります。同じ世代のモデルで生成した動画を続けて延長すると、映像と音が一般的に自然に接続しやすくなります。受け入れ確認の際は、境界の前後の映像、音、延長部分全体を同時に確認する必要があります。

---

SECTION 03 | さらに進んだ活用

3.1 キーフレーム、絵コンテ、ホワイトモデルの参照

先頭・末尾フレームと参照素材

マルチモーダル参照モードでは、プロンプトの最初の文に@画像1を先頭フレーム、@画像2を末尾フレームとして直接明記できます。単独の先頭・末尾フレームモードに切り替える必要はありません。システムは先頭フレームのアスペクト比で出力比率をロックし、尺は生成ページまたはAPIで設定します。先頭フレームと末尾フレームは同じアスペクト比を使用し、比率が一致しない場合は末尾フレームが引き伸ばされることがあります。

**基本テンプレート**:

@画像1は先頭フレームとして、動画開始時の構図、主体の位置、姿勢、道具の状態、シーン、カメラの方向を定義します。
@画像2は末尾フレームとして、動画終了時の構図、主体の位置、姿勢、道具の状態、シーン、カメラの方向を定義します。
@画像3は<主体A>の<外見、服装、構造または材質>に使用し、@画像1が定義する先頭フレームの構図は変えず、@画像2が定義する末尾フレームの構図も変えません。
@画像4は<主体B、道具、またはシーン>の<指定された属性>に使用し、@画像1が定義する先頭フレームの構図は変えず、@画像2が定義する末尾フレームの構図も変えません。
<連続した動作またはイベント>を記述します。映像は@画像1が定義する先頭フレームから自然に始まり、連続した動作を経て@画像2が定義する末尾フレームに到達します。先頭と末尾の間では<人物の身分、道具の構造と所有、シーンのレイアウト、カメラの方向>を連続させます。

**例**:

@画像1は先頭フレームとして、動画開始時の香水工房の構図、人物の位置、姿勢、卓上の道具の状態、カメラの方向を定義します。@画像2は末尾フレームとして、動画終了時の香水工房の構図、人物の位置、姿勢、卓上の道具の状態、カメラの方向を定義します。@画像3は<調香師>の顔、髪型、濃い緑色のエプロンに使用し、@画像1が定義する先頭フレームの構図は変えず、@画像2が定義する末尾フレームの構図も変えません。@画像4は<ガラス製の香水瓶>のフォルム、材質、ラベルの位置に使用し、@画像1が定義する先頭フレームの構図は変えず、@画像2が定義する末尾フレームの構図も変えません。<調香師>は先頭フレームの姿勢から始まり、スポイトと<ガラス製の香水瓶>を手に取り、琥珀色の香油を瓶に滴下し、そっと振って混ぜて栓を閉め、完成品を机の中央に置き、最後に@画像2が定義する末尾フレームに自然に到達します。先頭と末尾の間では<調香師>の身分と服装、香水瓶の数と構造、木製テーブルのレイアウト、暖色のサイドライト、カメラの方向を連続させます。
**注意**:各アンカー画像は個別に説明する必要があり、「画像1と画像2を先頭・末尾フレームとして使用する」のようにまとめてはいけません。先頭フレームと末尾フレームは同じアスペクト比を使用します。他の参照画像は指定された属性だけを提供し、先頭・末尾フレームの構図を代替しません。

複数キーフレームの順序制御

複数の独立した画像がそれぞれ過程の異なる段階を定義する場合は、プロンプトの最初の文に「@画像1から@画像Nの順序をキーフレームとする」と書き、その後に各画像が対応する重要な状態を1枚ずつ説明します。

**基本テンプレート**:

@画像1から@画像Nの順序をキーフレームとします。
@画像1は先頭フレームとして、<開始時の構図、主体の位置、姿勢、道具の状態、カメラの方向>を定義します。
@画像2は2番目のキーフレームを定義します:<第1段階の終了時に見える状態>。
@画像3は3番目のキーフレームを定義します:<第2段階の終了時に見える状態>。
@画像Nは末尾フレームとして、<終了時の構図、主体の位置、姿勢、道具の状態、カメラの方向>を定義します。
画面は@画像1、@画像2、@画像3から@画像Nが定義する状態を順に経由し、各段階の間は連続した動作で自然に移行します。過程全体で<主体の身分、道具の構造と所有、シーンのレイアウト、光、撮影の軸線>を連続させます。

**例**:

@画像1から@画像4の順序をキーフレームとします。@画像1は先頭フレームとして、オレンジ色の紙飛行機が教室の木製机の左側に静置され、機首が画面右側を向き、固定中景であることを定義します。@画像2は2番目のキーフレームを定義します:同じオレンジ色の紙飛行機が片手で机の上から持ち上げられ、機首の方向は変わりません。@画像3は3番目のキーフレームを定義します:同じオレンジ色の紙飛行機が窓辺をかすめて通り、カーテンが右へわずかに揺れます。@画像4は末尾フレームとして、同じオレンジ色の紙飛行機が右側の本棚の中段に着地し、機首は引き続き画面右側を向いていることを定義します。画面は@画像1、@画像2、@画像3、@画像4が定義する状態を順に経由し、各段階の間は飛行方向と速度を連続させます。過程全体で紙飛行機のオレンジ色の材質、大きさ、折り目、教室のレイアウト、午後のサイドライト、カメラの軸線を連続させます。

グリッドの絵コンテとストーリーボード

グリッドの絵コンテは、ストーリー全体、カメラの順序、大まかな構図を示すためのもので、各マスの詳細を厳密に再現することを要求する用途には適しません。15マス以内に収め、シンプルな線画またはすっきりとした模式図を使用し、文字による注釈は減らすことをおすすめします。

**基本テンプレート**:

@画像1は< >のカメラの順序と大まかな構図を提供し、<左から右、上から下>の順序で読み取ります。画像内の<線画の画風、文字による注釈、または仮の人物>は採用しません。
@画像2は<主体A>の<外見と服装>を定義します。
@画像3は<重要な道具またはシーン>の<構造、材質、または光>を定義します。
カット1:<画角、主体の動作、シーンの状態>。
カット2:<画角、主体の動作、カメラワークまたは切り替え方>。
……
カットN:<終了の動作と終了時の画面の状態>。
最終的な画面は<視覚スタイル>を採用し、音には<セリフ、環境音、動作の効果音、または音楽>が含まれます。

**例**:

@画像1は4マスの陶芸制作の絵コンテにおけるカメラの順序と大まかな構図を提供し、左から右、上から下の順序で読み取ります。画像内の線画の画風と文字による注釈は採用しません。@画像2は<陶芸家>の顔、ショートヘア、濃いグレーのエプロンを定義します。@画像3は<藍色釉薬のカップ>の器の比率、釉薬の色、アーチ形の持ち手を定義します。
カット1:広角で静かな陶芸工房を映し、<陶芸家>がろくろ機の前に座っています。
カット2:中景の横アングルで<陶芸家>が両手で回転する湿った陶土の土台を支え、器の形が徐々にできあがっていきます。
カット3:指でカップの口と持ち手のつなぎ目を整える特写で、泥が指先をゆっくりと滑り落ちていきます。
カット4:中近景で、焼き上がった<藍色釉薬のカップ>が木棚に置かれ、<陶芸家>が両手を引く様子を映します。
最終的な画面は写実的なドキュメンタリー風の質感を採用し、ろくろ機の回転音、湿った泥のこすれる音、工房の環境音を残します。

ホワイトモデルの参照とレンダリング

ホワイトモデルの参照には、粗粒度ホワイトモデルと細粒度ホワイトモデルがあります。

| タイプ | 適したケース | 素材の要件 | プロンプトの重点 |
|------|----------|----------|------------|
| **粗粒度ホワイトモデル** | シンプルな幾何体で動作、動線、立ち位置、カメラワーク、またはカットを事前に確認する | 幾何体の関係が明確で、動作のシーケンスが完備していること。人物、道具、シーンの画像を重ねられる | ホワイトモデルの主体を1つずつマッピングし、どの時系列情報と空間情報を継承するかを説明する |
| **細粒度ホワイトモデル** | すでに完全なモデリングがあり、人物、材質、色彩、シーン、またはスタイルを変更する必要がある | モデルの構造が完全で、画面がすっきりしていること。軌跡線、座標線、カメラのコーンビジュアライゼーションを避ける | 構造、動作、カメラを保持し、再レンダリングが必要な属性を明確にする |

粗粒度ホワイトモデル

粗粒度ホワイトモデルは、動作の軌跡、運動の方向、人物の立ち位置、出入り、カメラ位置の経路、カットの位置、光と影の変化、音のテンポを固定するのに適しています。

**ホワイトモデルの情報 → 説明が必要な内容**:

| 情報の種類 | 説明する内容 |
|----------|----------|
| **動線** | 動作の軌跡、運動の方向、人物の立ち位置、出入りの順序 |
| **カメラワーク** | カメラ位置、カメラの経路、運動の方向、速度の変化 |
| **照明** | 光の方向、明暗の変化、変化が起こるタイミング |
| **カット** | カットの位置、およびカット前後の主体と構図 |
| **音** | セリフ、音楽、環境音、または動作の効果音を継承するかどうか |

**基本テンプレート**:

@動画1は粗粒度ホワイトモデルの参照で、<動作の経路、人物の立ち位置、カメラ位置、カメラワーク、カット、光と影の変化、音のテンポ、または空間の関係>だけを提供し、ホワイトモデルの外観、材質、シーンは採用しません。
@動画1内の<ホワイトモデルの主体A>は<主体A>に対応します。
@動画1内の<ホワイトモデルの主体Bまたは幾何の道具>は<主体Bまたは重要な道具>に対応します。
@画像1は<主体A>の<外見、服装、または構造>を定義します。
@画像2は<主体B、重要な道具、またはシーン>の<指定された属性>を定義します。
<主体>は<シーン>で<主要な動作またはイベント>を完了します。@動画1内の<動作の経路、立ち位置、カメラワーク、カット、光と影、または音のテンポ>を保持します。最終的な画面は<人物、シーン、材質、視覚スタイル>を採用し、音には<セリフ、環境音、または動作の効果音>が含まれます。

**例**:

@動画1は粗粒度ホワイトモデルの参照で、人物の歩行経路、展示車の移動方向、固定カメラ位置、1回のプッシュイン、2回のカットだけを提供し、グレーの幾何体の外観と空白のシーンは採用しません。@動画1内の高い円柱体は<解説員>に対応します。@動画1内の直方体は<移動式展示車>に対応します。@画像1は<解説員>の顔、青色の制服、ネームプレートを定義します。@画像2は<移動式展示車>の白い金属製フレームと透明な展示カバーを定義します。@画像3はテクノロジー展示ホールのアーチ形の壁、グレーの床、天井のライトバーを定義します。<解説員>は<移動式展示車>を押しながらアーチ形の壁に沿って進み、中央の展示台の前で止まり、透明な展示カバーを開けます。@動画1内の歩行経路、主体の立ち位置、プッシュインの方向、カットの位置を保持します。画面は明るく写実的な展覧会場のドキュメンタリー風スタイルを採用し、足音、車輪の音、展示ホールの環境音を残します。
細粒度ホワイトモデル

細粒度ホワイトモデルは、すでに完全な人物、道具、またはシーンの構造を備えており、材質、色彩、人物のイメージ、シーン、全体の視覚スタイルを変更するのに適しています。ホワイトモデルの画面はできるだけすっきりとさせ、軌跡線、座標軸、コントローラー、カメラのコーンビジュアライゼーションなどの制作マーカーは残さないようにします。

**基本テンプレート**:

@動画1は細粒度ホワイトモデルの参照で、<主体の構造、動作、空間のレイアウト、カメラ位置、カメラワーク、カット>を保持し、元のグレーモデルの材質と空白の背景は採用しません。
@画像1は<主体>の<人物のイメージ、材質、色、または表面のディテール>を定義します。
@画像2は<シーン>の<空間、材質、光、または視覚スタイル>を定義します。
@動画1内の<主体>を<最終的な主体>へ再レンダリングし、シーンを<最終的なシーン>へ再レンダリングします。@動画1内の<構造、動作、カメラ、空間の関係>を保持し、画面は<材質、色彩、スタイル>を呈し、音には<環境音、効果音、または音楽>が含まれます。

**例**:

@動画1は細粒度ホワイトモデルの参照で、環状装置の完全な構造、3層のリングの回転関係、展示台の位置、周回カメラワーク、カットを保持し、元のグレーモデルの材質と空白の背景は採用しません。@画像1は装置の外側のリングのヘアライン加工された真鍮の材質を定義します。@画像2は内側の羽根の半透明な青いガラスの材質を定義します。@画像3は現代アート展示ホールの白い曲面の壁、濃いグレーの床、天井からの柔らかな光を定義します。@動画1内の環状装置を、真鍮と青いガラスで構成されたダイナミックな彫刻へ再レンダリングし、シーンを現代アート展示ホールへ再レンダリングします。@動画1内の構造、回転のテンポ、周回カメラワーク、カットを保持し、装置の低い回転音と静かな室内の環境音を残します。

---

3.2 ワンクリック動画制作

ワンクリック動画制作は、複数の画像、または画像とスタイル参照動画を、統一されたテンポとパッケージスタイルを持つ完成動画にまとめるのに適しています。プロンプトでは、各素材の役割、画像の順序、画面の動き、編集のテンポ、視覚的なパッケージ、音を説明する必要があります。「これらの素材で動画を作って」とだけ書いてはいけません。

**ORDER:素材の役割 → 画像の順序 → 動きの大きさ → 編集スタイル → 視覚的なパッケージ → 音**

基本テンプレート

[素材の役割]@画像1は<人物、商品、シーン、またはオープニング画面>に使用します。@画像2は<人物、商品、シーン、または過程の画面>に使用します。@画像3は<人物、商品、シーン、またはエンディング画面>に使用します。@動画1は<編集のテンポ、トランジション、字幕パッケージ、または音楽スタイル>だけに使用し、中の人物の身分とシーンは採用しません(任意)。

[構成方法]画像は<アップロード順、指定された順序、またはテーマに沿った自由な構成>で出現します。<保持すべき人物、商品、場所、イベントの関係>を説明します。

[画面の動き]各画像は<軽いLiveモーションエフェクト、パララックス、プッシュ・プル、横移動、または部分的な動作>を採用します。<主体の外観、商品の構造、文字、または背景の関係>を安定して保ちます。

[完成動画のスタイル]<編集のテンポ、トランジションの方法、字幕またはグラフィックのパッケージ、色彩スタイル>を採用します。

[音]<セリフ、環境音、効果音、または音楽>が含まれます。

例:ナイトマーケット旅行ショート動画

**素材の役割**
- @画像1はナイトマーケットの入口とオープニングの環境に使用します。
- @画像2は<旅行者>が通りに沿って歩く画面に使用します。
- @画像3はランタンの屋台と手工芸のディテールに使用します。
- @画像4は3人の友人がテーブルを囲んで食事をする画面に使用します。
- @画像5は川辺の夜景と水面に映る影に使用します。
- @画像6は3人が橋のそばで記念撮影をするエンディング画面に使用します。
- @動画1は軽快な編集テンポ、手書きのステッカー、トランジションの方法だけに使用し、中の人物の身分と場所は採用しません。
**構成方法**
画面は@画像1から@画像6の順序で出現し、「ナイトマーケット到着、通り沿いの散策、食事、散歩、記念撮影」という一連の流れを構成します。3人の友人の外見と服装を安定して保ち、互いに混ざらないようにします。
**画面の動き**
環境の画像はゆっくりとしたプッシュインとわずかなパララックスを採用します。人物の画像は、自然な瞬き、首を向ける動作、グラスを挙げる動作、衣類の風に揺れる動きだけを加えます。屋台の構造、テーブルの位置、橋のそばの手すりを安定して保ちます。
**完成動画のスタイル**
明るい旅行ショート動画のテンポを採用し、シーン間は自然なオクルージョンと近い色彩でつなぎます。手書きのステッカーは画面の端にだけ表示します。
**音**
ナイトマーケットの人の声、食器の軽やかな音、川辺の風の音を残し、軽快だが過度に目立たない器楽音楽を合わせます。
**注意**:画像の順序が重要な場合は、出現順序を1枚ずつ明記します。モデルに自由な構成を許可する場合も、「テーマに沿って自由に構成してよい」と明確に書きます。複数の人物や複数の商品が関わる場合は、引き続きそれぞれに名前を付け、素材に紐づける必要があります。

---

3.3 動画のシームレスなトランジション

動画のシームレスなトランジションは、2本の動画の間に連続的な移行内容を生成するものです。プロンプトでは、どちらがトランジション前の動画で、どちらがトランジション後の動画かを先に説明し、その後にトリガーとなる動作、カメラの動き、画面がどう変化するか、最終的に到達する状態、音のつなぎ方を明確に書きます。

**ORDER:トランジション前の動画 → トランジション後の動画 → トリガーとなる動作 → カメラの動き → 画面の変形 → 到達する状態 → 音**

5つのトランジション方法の書き方の重点

| トランジションの方法 | 書き方の重点 |
|----------|----------|
| **ダイブ(急降下)または折り返し** | カメラの方向、速度の変化、いつ次のシーンに入るかを説明する |
| **人物の回転** | 人物の姿勢、回転の方向、服装または背景がどう連続して変化するかを説明する |
| **前景の遮蔽** | 遮蔽物がいつ画面全体を覆うか、遮蔽後に現れる構図を説明する |
| **物体の変形** | 前後の物体に対応する形状、材質、変形の過程を説明する |
| **プッシュ・プルまたは焦点の変化** | カメラの動き、焦点を合わせる対象、前後の空間の連続関係を説明する |

基本テンプレート

@動画1はトランジション前の断片で、その<末尾の主体、動作、構図、カメラの方向、音>を採用します。
@動画2はトランジション後の断片で、その<冒頭の主体、構図、カメラの方向、音>を採用します。
@動画1と@動画2の元の断片における<人物の身分、商品の構造、シーン、主要な動作>を安定して保ちます。
@動画1の末尾で、<主体または前景の物体>が<動作>によってトランジションをトリガーします。カメラは<運動の方向と速度の変化>で、画面内の<形状、材質、光、または空間>が徐々に@動画2の冒頭の<対応する要素>へ変化します。トランジション終了時には@動画2の冒頭の構図に自然に到達し、<主体の位置、カメラの方向、運動の傾向>を連続させます。
音は<前の断片の音>から<後の断片の音>へ滑らかに移行します。

例:

@動画1はトランジション前の断片で、雨の夜の通り、赤い傘、ゆっくりと前方へプッシュインするカメラ、雨音を採用します。@動画2はトランジション後の断片で、展示ホールの円形の天窓、上方へ持ち上げるカメラ、静かな室内の残響を採用します。2本の元動画における人物、通り、展示ホールの構造、主要な動作を安定して保ちます。@動画1の末尾で、赤い傘がカメラに近づき、徐々に画面全体を覆ってトランジションをトリガーします。カメラは前方へのプッシュインを続け、傘の円形の縁が徐々に展示ホール天窓の金属製のリングになり、赤い傘の布が徐々に天窓から差し込む白い空の光へ変化します。トランジション終了時には@動画2の冒頭のローアングル構図に自然に到達し、カメラは前方へのプッシュインから上方への持ち上げへと滑らかに転じます。雨音は徐々に弱まり、展示ホール内の足音の反響へと滑らかに移行します。
**注意**:シームレスなトランジションの目標は、画面と音を自然につなぐことです。プロンプトで2本の元動画の主要内容を保持するよう要求できますが、生成による移行を、ピクセル単位で変わらない編集のつなぎ合わせと理解してはいけません。

---

3.4 感情の方向と観察可能な表現

「緊張」「ほっこり」「抑圧された」といった感情の言葉だけを書けば、モデルは全体的な方向を理解できますが、具体的な演技には自由度が生まれます。人物の演技を安定して制御したい場合は、目、眉、口元、呼吸、視線、手の動きなど、直接見たり聞いたりできる表現を明記することをおすすめします。

すべての顔のディテールを羅列する必要はありません。1回の感情の転換では、通常、最も明確な2~4つの表現を選ぶだけで十分です。感情が複数回転換する場合にのみ、トリガーとなるイベントに応じて段階ごとに記述します。

1回の感情の転換:既定の書き方

全体的な感情は<開始時の感情>から<終了時の感情>へ転換します。<トリガーとなるイベント>が起こると、<主体>はまず<即座に観察できる反応>を見せます。続いて、<目、眉、口元、呼吸、視線、または手の動き>が徐々に<変化>していきます。最後に、<主体>は<抑制的または明確な外見上の表現>で<目標の感情>を表します。

多段階の感情:トリガーとなるイベントに応じて進行

<最初のトリガーとなるイベント>を聞いたり見たりすると、<主体の最初の観察可能な反応>。次に<2番目のトリガーとなるイベント>が現れると、<主体の表情、視線、または呼吸に起こる変化>。<重要な情報>を確認した後、<主体が抑えたり隠そうとしたりする感情>が<観察可能な表現>を通じて徐々に現れます。最後に、<主体の最終的な動作、表情、または話し方>。

例:

舞台の後方から公演終了の拍手が聞こえてきます。若い俳優がパンフレットを握る指が突然止まり、視線はゆっくりと幕の方向へ向きますが、肩はまだ強張っています。カーテンコールを確認すると、彼女はまずそっと息を吐き出し、肩が徐々に力を抜き、口元に抑えた笑みが浮かび、目がじわりと潤みますが、最後まで振り返って立ち去ることはありません。

---

3.5 専門的な撮影用語

基本的なカメラ言語や人気のカメラワークは、そのままプロンプトに書けます。用語があまり一般的でない、複数の解釈があり得る、または画面の変化を精密に制御する必要がある場合は、用語が誰に作用するか、画面がどう変化するか、期待する結果を併せて説明します。

基本的なカメラ言語

| カテゴリ | 用語 |
|------|------|
| **画角** | 大パノラマ、フルショット、ミディアムショット、近景、クローズアップ |
| **カメラワーク** | プッシュイン、ズームアウト、パン、トラッキング(移動)、フォロー、周回、ダイブ(急降下)、プルバック、ティルトアップ、手持ちブレ |
| **カメラ位置と視点** | ローアングル、俯瞰、一人称 |

7種類の人気カメラワークの推奨書き方

| カメラワーク | 推奨の書き方 |
|----------|----------|
| **一発撮り(ワンカット)** | カメラが連続して通過する主体、空間、イベントの順序を説明する |
| **ヒッチコックズーム** | 主体が保つ大きさ、背景の空間が近づいたり遠ざかったりする効果を説明する |
| **空撮視点** | 俯瞰する高さ、移動の方向、見せたい環境の範囲を説明する |
| **FPV** | 一人称の飛行または通過の経路、速度、方向転換を説明する |
| **バレットタイム** | 凍結またはスローにされる動作、カメラの周回方向を説明する |
| **手持ちカメラ** | 追いかける対象とブレの程度を説明する。「手持ち感」だけがありカメラの目標がない状態は避ける |
| **リバウンドの速度変化** | 動作がどの時点で加速、減速、またはリバウンドするか、最終的な停止状態を説明する |

あまり一般的でない撮影用語

あまり一般的でない、業界によって意味が統一されていない、またはモデルがよく知らない可能性がある用語は、用語名を残しつつ、直接観察できる画面の変化に言い換える必要があります。

**FORMULA:専門用語 + 作用する主体 + 画面の変化 + 前景/背景の関係 + 方向または速度**

**例**:

フォーカス移動:ピントが前景の葉から背景の人物へ滑らかに移ります。葉は徐々にぼけ、背景の人物の顔はぼやけていた状態から鮮明になります。

撮影表現の例

  1. **浅い被写界深度のポートレート**:<パティシエ>の目と顔を鮮明に保ち、背後にあるガラスの瓶と照明は、柔らかな円形のボケにぼかします。
  1. **流し撮り(パンニング)**:カメラを<スケートボーダー>と同じ速度で水平に動かし、人物を鮮明に保ち、街路の壁が右から左への水平な流線になります。
  1. **ゴールデンアワー**:暖色の低角度の太陽光が<登山者>の左後方から差し込み、山の尾根の地面に長い影ができます。
  1. **自然なビネット**:画面の四隅が徐々に暗くなり、中央の<ピアニスト>の明るさと肌の色は正常に保たれ、黒い枠は現れません。
  1. **ウィップパンのトランジション**:5秒目にカメラが素早く左へ横移動します。前景の本棚が画面全体を覆うと次のシーンへ切り替わり、切り替え後もカメラは左への移動と同じような速度を保ちます。

---

SECTION 04 | 提出前のチェックリスト

  • [ ] 主体と主要な動作またはイベントが明確に書かれていますか?
  • [ ] 各参照素材について、何を採用し何を採用しないか明確に説明されていますか?
  • [ ] 異なる人物、商品、道具はそれぞれ名前を付け、素材に紐づけられていますか?
  • [ ] 複数の素材は、すべてを同時に出すのではなく、シーンに応じて選択されていますか?
  • [ ] 長尺動画の各段階で主要な変化が1つだけで、終了状態が明確に書かれていますか?
  • [ ] 人物の人数、服装、道具の所有、空間の関係は安定していますか?
  • [ ] 動画編集で、唯一のマスタービデオ、修正範囲、目標の数量、保持内容が明確になっていますか?
  • [ ] 抽象的な感情や撮影用語が、直接見たり聞いたりできる表現に対応していますか?
  • [ ] 先頭・末尾フレームと複数キーフレームは、各画像の役割が1枚ずつ説明され、先頭フレームと末尾フレームが同じアスペクト比を使用していますか?
  • [ ] グリッドの絵コンテで継承する構造が明確に書かれていますか。ホワイトモデルはまず粗粒度か細粒度かを判断し、継承すべき時系列、構造、材質、スタイルが書かれていますか?
  • [ ] 動画編集、先頭・末尾フレーム生成、動画延長で、自動ロックされる比率と尺の規則に従っていますか?
  • [ ] 動画延長で、境界の画面、運動の傾向、音の連続性が同時にチェックされていますか?
  • [ ] ワンクリック動画制作で、素材の役割、画像の順序、動きの大きさ、編集スタイル、音が説明されていますか?
  • [ ] シームレスなトランジションで、2本の動画の役割、トリガーとなる動作、移行の過程、到達する状態が明確に書かれていますか?

---

SECTION 05 | 使用上の制約

9つの能力の制約

  1. **タイムスタンプ**はイベントのテンポを割り当てるためにのみ使用でき、フレームレベルの編集ポイントではありません。
  1. **動画編集**のプロンプトは、重要なイベントを元動画に合わせられる確率を高めますが、フレーム単位で完全に一致することを保証するものではありません。
  1. **マルチ素材の創作**の重点は素材を正しく選択・組み合わせることであり、すべての素材を同時に出すことではありません。
  1. 完全に正確でなければならない**字幕、数式、看板、製品パラメータ、フレームレベルの時間点**は、事前に合成した素材+動画生成+後編集で完成させることをおすすめします。
  1. **動画編集**は入力動画の比率と基本尺をロックします。この2つは別途設定できず、出力尺は入力動画と最大約0.3秒の差が生じることがあります。
  1. **先頭フレームまたは先頭・末尾フレーム生成**は、先頭フレームのアスペクト比で比率をロックし、尺は設定できます。先頭と末尾の画像の比率が異なると、末尾フレームが引き伸ばされることがあります。
  1. **動画延長**は入力動画の比率をロックし、延長する尺は設定できます。延長部分の音量は元動画とわずかに異なることがあります。
  1. **ワンクリック動画制作**では、画像の順序や人物の対応関係が重要な場合は、プロンプトで明確に指定する必要があります。
  1. **動画のシームレスなトランジション**は視覚と音の連続性を追求するもので、2本の元動画がピクセル単位で変わらないことを意味するものではありません。

---

SECTION 06 | ガイドの免責事項

本ガイドの例は、プロンプトの書き方を説明するためのものです。実際の生成結果は、入力素材、タスクの複雑さ、生成パラメータの影響を受けることがあります。

Public Sunday routes

About this route

Seedance 2.5 supports text-to-video, head-tail frames, and multimodal reference workflows. Audio-only references are accepted, and reference videos help guide motion and rhythm.

Choose 480p, 720p, or 1080p output and use prompts and references to guide the look, motion, and atmosphere of each video.

Seedance 2.5 workflow

Longer native video

Generate complete clips from 4 to 30 seconds without stitching short tasks.

More controllable multimodal workflows

Combine supported image, video, and audio references in one task.

A familiar creation workflow

Use the same generator, Star billing, and task history as other Seedance models.

Seedance 2.5 questions

Is Seedance 2.5 already available inside the generator?

Yes. Select Seedance 2.5 in the video generator, then choose 480p, 720p, or 1080p and a duration from 4 to 30 seconds.

Does Seedance 2.5 support Creative Mode or 4K?

No. Seedance 2.5 currently supports standard generation at 480p, 720p, or 1080p. Creative Mode is available for Mini, Fast, and High workflows.