
AI動画の自然な演技をビートシートで計画する
AI動画で信頼できる会話シーンを実装するビートシート、キャラクター状態定義、カメラプログレッション、プロンプトテンプレート、検証フロー、API実装例を学べます。
信頼できるAI動画の演技は、長い感情リストではなく、ビートシートから始まります。 ビートシートは場面を小さな変化に分けます。キャラクターがセリフを聞き、ポーズをとり、目をそらし、決断を下し、話す。ビートの終わりに見える状態を定義すれば、次の瞬間は具体的な出発点を持ちます。
このビギナー向けチュートリアルは、短い会話シーンをアイデアから検証まで構築します。詳細なプロンプトに対応するあらゆるビデオモデルに対応できます。APIの例ではreAPI上のSeedance 2.5を使っており、生成オーディオと30秒までのクリップを1リクエストで対応しています。[1]
TL;DR
- 場面中に何が感情的に変わるか、1文で書く。
- 各キャラクターに安定した初期状態、秘密の目標、プレッシャーポイントを付ける。
- 場面を1つの行動または反応程度のビートに分ける。
- 各ビートを見える状態で終わらせる。視線、姿勢、距離、小道具、表情など。
- セリフ、演技、ブロッキング、カメラ、サウンドを別のプロンプトブロックに分ける。
- クリップを受け入れる前に、セリフ割り当て、ポーズ、視線、手、スクリーン方向、終了状態を確認する。

演技ビートとは何か
演技ビートは場面での最小の意味のある変化です。単なる時間範囲ではありません。キャラクターが知ること、望むこと、することが変わる何かが起こる必要があります。
このセリフを考えてみてください:
Maya: "もう荷造りしたの?"「Mayaは悲しく見える」は弱い指示です。一般的な雰囲気を説明しているだけですから。ビートはより有用です:
Mayaはセリフを言う前にスーツケースに気づきます。彼女の肩の動きが止まります。スーツケースを見てからLeoを見て、静かに、
「もう荷造りしたの?」と聞きます。彼女は視線を保ちながらビートを終わらせ、彼の返事を待ちます。2番目のバージョンはモデルに引き金、順序、話し方、終了状態を与えます。これらは抽象的なラベルではなく、見える指示です。
ステップ1:場面を1つの感情変化に縮める
セリフを書く前に、この文を完成させます:
場面は__________で始まり、__________で終わります。理由は__________だからです。例えば:
場面は、Mayaが普通の別れを予想した状態で始まり、彼女が荷造り済みのスーツケースを見て、Leoが彼女に告げずに立ち去るつもりだったことに気づく状態で終わります。これが場面の骨組みです。提案されたカメラの動き、ジェスチャー、余分なセリフが視聴者にその変化を理解させなければ、削除します。初心者は1つの生成に複数の感情的転機、場所の明かし、商品配置、複雑なカメラの振り付けを求めることが多くあります。モデルはその時、注意を多くの仕事に分散させます。
1つの転機から始めます。シンプル版が機能してから、複雑さを追加します。
ステップ2:コンパクトなキャラクター状態カードを書く
モデルは伝記のページは不要です。この場面に影響する詳細が必要です。
{
"maya": {
"starting_state": "リラックス、普通の別れを予想",
"goal": "正直な説明を得る",
"pressure_point": "重要な決定から除外されることへの不安",
"default_behavior": "誰かに対面する前は静かにしている",
"fixed_visuals": "黒いボブ、緑のコート、銀の腕時計"
},
"leo": {
"starting_state": "警戒的で去りたい気分",
"goal": "罪悪感を認めずに会話を終わらせる",
"pressure_point": "直接的な目を合わせること",
"default_behavior": "不快な時は近くのものを手に取る",
"fixed_visuals": "短い茶髪、濃いグレーのジャケット、黒いスーツケース"
}
}default_behaviorフィールドは特に便利です。「緊張」はランダムなまばたきと誇張された顔の動きになります。「不快な時にスーツケースのハンドルを回す」はパフォーマンスに物理的な発散口を与えます。
顔の再現が重要な場合、生成前に明確な参照画像を準備します。このチュートリアルはパフォーマンス計画に焦点を合わせており、キャラクター一貫性ワークフローでより詳しく参照準備を説明しています。
ステップ3:セリフをタイミング付きビートに変える
短い場面では4~6つのビートを使用します。正確な秒数は目安であり、フレーム精度の編集決定ではありません。重要なのは順序と明確な終了状態です。
| 時間 | トリガー | 見える演技 | セリフ | 終了状態 |
|---|---|---|---|---|
| 0–4秒 | Mayaがスーツケースを見る | 歩みが止まる、目がスーツケースに動く | なし | Maya動かず、スーツケースは二人の間に |
| 4–8秒 | Leoが気づく | ハンドルを握りしめ、目を合わさない | Maya: 「もう荷造りしたの?」 | Leoは出口を向く |
| 8–13秒 | 沈黙が不快になる | Mayaが近づき、Leoが息を出す | Leo: 「その方が楽だったんだ」 | 二人は動かず |
| 13–19秒 | Mayaが理解する | 短く下を向き、その後視線を戻す | Maya: 「誰のためのことですか?」 | Mayaは落ち着き、Leoは困窮 |
| 19–24秒 | Leoは答えられない | ハンドルから手が離れ、姿勢が柔らかくなる | なし | 沈黙、和解なし |
すべてのビートがセリフを含むわけではないことに注意してください。沈黙はモデルに反応の時間を与えます。連続する重なるセリフより、スピーカー割り当てもより明確です。
ステップ4:カメラ動きの前にブロッキングを計画する
ブロッキングは人やオブジェクトの位置です。カメラ指示は観客がそのブロッキングをどう見るかです。1番目を固定してから2番目を追加します。
例の場面:
- Mayaは画面左から始まり、スーツケースから2メートル離れて。
- Leoは画面右から始まり、右手がハンドルの上に。
- スーツケースは二人の間に止まる。
- 誰も中心線を越えない。
- 3番目のビート中にMayaが1歩前に進む。
- Leoは最後のビート前に立ち去らない。
これらの制約はスクリーン方向を保護し、後の編集をより簡単にします。その後、シンプルなカメラの進行を追加します:
0-8秒:ロックされた中くらいの2ショット。
8-19秒:より密集した2ショットへのゆっくりしたプッシュ。
19-24秒:保持。追加のカメラ動きはなし。カメラがすべての感情を実行させないでください。突然のオービット、クレーンムーブ、ズームは演者と競合できます。会話テストの場合、1つの控えめな動きで十分です。
ステップ5:プロンプトを6つのブロックに組み立てる
別のプロンプトブロックはエラーの診断をより簡単にします。カメラが間違っていれば、キャラクター識別やセリフを書き直さずにカメラブロックを編集できます。
参照
画像1はMayaのアイデンティティとワードローブ参照です。画像2はLeoのアイデンティティと
ワードローブ参照です。画像3は駅の入口、照明、初期ブロッキングを定義します。
キャラクター
Mayaは誰かに対面する前に静かにしています。Leoは不快な時にスーツケースを扱います。
年齢、顔の特徴、髪、衣類、体の比率を全体で保持します。
シーンとブロッキング
夜間、駅の外。Mayaは画面左に止まります。Leoは画面右に止まります。黒いスーツケースは二人の間に止まります。
位置を変えません。
パフォーマンスタイムライン
0-4秒:Mayaが入場し、スーツケースに気づき、立ち止まり、スーツケースからLeoを見ます。
終了:Mayaが動かず、Leoが気づかない。
4-8秒:Leoが気づき、ハンドルを握りしめ、彼女を見ません。Mayaは静かに、
「もう荷造りしたの?」と聞きます。終了:Leoは出口を向く。
8-13秒:Mayaが1歩近づきます。Leoが息を出し、「その方が楽だったんだ」と言います。終了:二人は動かず。
13-19秒:Mayaが短く下を向き、視線を取り戻し、「誰のためのことですか?」と聞きます。
終了:Mayaは落ち着き、Leoは答えられない。
19-24秒:Leoがハンドルから手を離し、わずかに柔らかくなります。誰も話しません。
未解決な沈黙で終了。
カメラ
0-8秒:ロックされた中くらいの2ショット。8-19秒:より密集した2ショットへのゆっくりしたプッシュ。
19-24秒:保持。両方の顔を見える状態に保ち、左右の軸を保持します。
サウンドと制約
自然なアメリカ英語。正確なセリフとスピーカー割り当てを保持します。静かな駅の環境音。
ナレーション、字幕、追加の会話、背景音楽、誇張された泣きなし。ByteDanceはSeedanceが多モーダル入力から構成、動き、カメラ言語、サウンドを参照できることを記録しています。また、モデルは複数主体の一貫性とテキスト精度についてまだ改善の余地があることに注記しており、このため参照ロールとレビュー段階が重要です。[2]
ステップ6:最終シーンの前にリハーサルを生成する
短く、低リスクのリハーサルを使って、スピーカー順序、ブロッキング、感情的なタイミングをテストします。衣装のテクスチャや最終色はまだ評価しません。
reAPIでは、最小限のSeedance 2.5リクエストは次のようになります:
curl https://reapi.ai/api/v1/videos/generations \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "doubao-seedance-2.5-face",
"prompt": "PASTE_THE_SIX_BLOCK_PROMPT_HERE",
"image_urls": [
"https://example.com/maya.jpg",
"https://example.com/leo.jpg",
"https://example.com/station.jpg"
],
"resolution": "720p",
"size": "16:9",
"duration": 24,
"generate_audio": true
}'リクエストは非同期です。返されたタスクIDをポーリングし、ステータスがcompletedまたはfailedになるまで待ちます。現在のフィールド制限と課金ルールは、ハードコーディングされたクライアント仮定ではなく、Seedance 2.5 APIドキュメントに記載されています。
ステップ7:正しい順序でパフォーマンスを検証する
結果を3回見て、毎回異なる目的で見ます。
パス1:サウンドのみ
見ないで聞きます。正確なセリフ、スピーカー割り当て、セリフ順序、不要なナレーション、ペース、ポーズがビートシートの要求する場所に存在するかを確認します。
パス2:音なし画像
クリップをミュートします。視線、体の位置、手の動き、顔の連続性、スクリーン方向、各ビートが計画状態で終わるかを確認します。
パス3:完全なシーン
会話、反応、カメラ、サウンドが同じ転機をサポートするかどうかを判断します。1つのレイヤーが失敗した場合、最初にそのレイヤーを修復します。1つのポーズが短すぎるため、全体のシーンを書き直さない。
シンプルな受け入れシートを使います:
{
"speaker_order": "pass",
"exact_dialogue": "pass",
"left_right_axis": "pass",
"beat_3_end_state": "repair",
"identity": "pass",
"camera": "pass",
"repair_note": "Leoが早くMayaを見ます。13秒まで出口を見続けるようにしてください"
}これはAI動画批評ループと同じ原則です。クリップが「良い感じがする」かどうかを聞く代わりに、明示的な証拠に対して受け入れるか修復します。
一般的な初心者の間違い
| 間違い | 失敗する理由 | より良い動き |
|---|---|---|
| 「悲しく、映画的、感情的」と書く | 気分の言葉は行動を定義しない | トリガー、物理的な反応、終了状態を追加 |
| 両方のキャラクターに絶え間ない動きを与える | シーンは忙しく不明瞭になる | 1つが演じ、もう1つが受ける |
| 毎秒セリフで満たす | 反応は登録する時間がない | ビートを沈黙用に取っておく |
| 毎ビート後にカメラスタイルを変える | カメラはパフォーマンスと競合 | 1つのプログレッションと1つのホールドを使う |
| 1つの欠陥後にすべてを再生成 | 良い部分が失われる | 最小の失敗ブロックを修復 |
| シーン内で正確なブランドテキストを求める | 生成されたテキストは信頼できない可能性がある | 重要なコピーは本番後に追加 |
よくある質問
初心者が何個のアクティングビートを使うべきですか?
4~6から始めます。各ビートは1つのメインのトリガーまたは反応を含むべきです。行が何が変わるかを説明するのに複数の文が必要な場合、分割します。
タイムコードは正確なタイミングを保証しますか?
いいえ。ペーシング指針として扱います。レンダリングされた結果を確認し、正確な配信タイミングが重要な場合はエディタでトリミングします。
すべての感情が顔に見える必要がありますか?
いいえ。姿勢、視線、距離、手の動き、沈黙はしばしば誇張された表現より明確に伝わります。
キャラクター参照画像なしでこのワークフローを使用できますか?
はい。ただし、視覚的なアイデンティティはより制限されます。特定の人またはシリーズフィクション文字が認識可能である必要がある場合、参照がより重要になります。
会話シーンが失敗した場合、最初に何を修復すべきですか?
微妙な感情の前にスピーカー順序とブロッキングを修復します。美しくレンダリングされた反応は、間違ったキャラクターが話す、または間違った側に交差するシーンを保存できません。
結論
AI動画演技ビートシートは感情的なアイデアを観察可能な作業に変えます。トリガー、反応、セリフ、ブロッキング、終了状態、レビュー基準。1つの簡単な転機を構築し、沈黙に余地を与え、カメラを抑制します。そのバージョンが機能したら、シーンの制御を失わずにより複雑なパフォーマンスを追加できます。
References
- ByteDance Seed. One-take Creation, Flexible Referencing: Introducing Seedance 2.5. July 31, 2026. seed.bytedance.com
- ByteDance Seed. Seedance 2.0 Official Launch. February 12, 2026. seed.bytedance.com
- reAPI. Seedance 2.5 API — Parameters, Modes & Billing. Retrieved August 27, 2026. reapi.ai
著者

カテゴリ
他の記事

ゲーム向けAI画像生成:キャッシング戦略で効率化
セマンティックキーとキャッシュ優先フロー、単発リクエスト、非同期ポーリング、予算枠、耐久ストレージで、ゲーム画像生成パイプラインのコスト削減と実装を解説します。


Seedance 2.5 API料金比較:四社の実価格
Seedance 2.5のAPI料金を2026年8月に四社で比較。reAPI、fal.ai、kie.ai、WaveSpeed。価格差は最大1.8倍、参照動画の課金ルール異なり、実例3つ付き。


Claude Opus 4.8 活用ガイド:ベンチマーク、信頼性、コスト
Claude Opus 4.8の公式ベンチマーク表、信頼性の向上、Dynamic Workflows、デフォルト努力レベルの変更、マイグレーション計画のポイントを解説します。
