テキストからビデオへの変換が探索に最適な場合、画像からビデオへの変換は制御に最適です。
これは、Seedance 2.5 の画像からビデオへの変換をいつ使用するかを決定する最も簡単な方法です。ワークフローによりモデルに視覚的なアンカーが与えられ、被写体のアイデンティティ、製品の形状、衣装の詳細、フレーミング ロジック、全体的な構成を保持しやすくなります。
より予測可能な結果が必要なクリエイターにとって、これは多くの場合、空のプロンプトから開始するよりも優れています。
生成する前に 2 つのアプローチを比較したい場合は、Seedance 2.5 モデル ガイド の概要から始めて、次に、image-to-video と Seedance 2.5 を選択した C ダンス AI ワークスペース で独自のワークフローをテストします。
画像からビデオへの変換がテキストからビデオへの変換を上回るとき
次のいずれかが重要な場合は、画像からビデオへの変換を使用します。
- 顔やキャラクターのデザインは認識可能なものでなければなりません
- 製品の形状が一貫していなければなりません
- 構図はすでに機能しており、必要なのは動きだけです
- キーアート、写真、またはコンセプトフレームをアニメーション化したい場合
テキストからビデオへの変換は発明に適しています。画像からビデオへの変換は保存に適しています。
Seedance 2.5 プロンプト構造を維持
目に見える主題から始めて、アクション、環境の反応、カメラ、サウンド、および終了状態を説明します。この順序により、プロンプトはモデルが見せたり聞いたりできるものに関連付けられます。また、修正も容易になります。顔がずれている場合は、被写体の制約を変更します。カメラがふらふらする場合は、カメラのラインを変更します。クリップがビートなしで終了する場合は、最終状態を変更します。
この作業用テンプレートを使用します。
件名: [冒頭のフレームに映っている人物または内容]
アクション: [明確な始まりと終わりを持つ 1 つのメイン アクション]
環境: [動くもの、反応するもの、静止しているもの]
カメラ: [撮影サイズ、動き、速度、角度]
オーディオ: [会話、物理的な音、雰囲気、または音楽]
エンディング: [最後のポーズ、フレーム、またはトランジション]
制約: [アイデンティティ、製品の形状、テキスト、または構成] を保持します。
テンプレートは魔法の公式ではありません。これは、実際の動作を曖昧にしたまま、プロンプトの大部分をムードワードに費やすというよくある間違いを防ぐためのチェックリストです。
テキストからビデオへの変換の例: 1 つのアクション、1 つのカメラ移動
空白のキャンバスの場合、モーションを要求する前に最初のフレームを定義します。短い風景クリップの使用可能なプロンプトは次のようになります。
日の出直前の濡れた山道で、赤いロードバイクの横で一人のサイクリストが待っています。サイクリストは前輪をチェックし、自転車に乗り、浅い水域を前に進みます。カメラは中程度の横顔で開始し、3 秒間平行に追跡し、道路が左にカーブするときにライダーに向かってゆっくりと押し込みます。タイヤから水が飛び散り、自転車の後ろに溜まります。ライダーの赤いジャケット、自転車のフレーム、道路の方向を一致させてください。自然なタイヤと水の音、会話はありません。道路と青白い空が見えたまま、自転車がフレームから離れるところで終わります。
このプロンプトには 1 つの主要アクションと 1 つのカメラ変更があります。結果が多すぎる場合は、件名の説明を変更する前にプッシュインを削除してください。いくつかの次元を一度に変更すると、次世代の診断が困難になります。
画像からビデオへの例: 画像ではなく変更について説明します
ソース画像に主題と構図がすでに含まれている場合は、修正しておく必要がある詳細のみを繰り返します。プロンプトを使用して、フレーム 1 の後に何が起こるかを説明します。
提供された製品写真をアニメーション化します。ボトルのラベル、キャップ、グラスの形状、テーブルトップの位置、および暖かい側の照明を変更しないでください。ボトル上に結露の細いリボンが形成され、2 つの液滴が下に移動します。カメラは同じ高さを保ちながら、4 分の 1 回転未満の非常に小さな時計回りの円弧を描きます。静かなガラスの蛇口とお部屋の雰囲気をプラスします。ボトルを中央に置き、完全に読み取れるようにして終了します。
「変更しない」というフレーズは、具体的な視覚プロパティに名前を付ける場合に便利です。画像内のすべてのピクセルの長いリストになると、あまり役に立ちません。ショットにとって重要な詳細を 3 ~ 5 つ選択します。
マルチショット プロンプトにはタイムスタンプが必要です
複数のビートを含むシーケンスの場合は、同時アクションを 1 段落にまとめる代わりに、コンパクトなショット リストを作成します。各ショットに継続時間、フレーミング、アクション、トランジションを与えます。
0-3 秒、ワイドショット: パン屋が夜明けに小さな店を開き、看板を点灯します。
3 ~ 6 秒、中程度のショット: パン屋が生地をこねるにつれて小麦粉が上昇し、カメラはロックオフされています。
6 ~ 9 秒、クローズアップ: パン屋が温かいパンを切ります。蒸気が前景を横切ります。
9 ~ 12 秒、ゆっくりと後退します。最初の顧客が入場し、ベルが鳴り、混雑したカウンターで終わります。
被写体の身元と場所を行全体で一貫して保ちます。モデルがショットの間に新しい部屋を発明する場合は、「青いタイルと正面窓のある同じ狭いパン屋」などの共有アンカーを 1 つ追加します。すべてのショットに形容詞を追加することで連続性の問題を解決しないでください。
テストが簡単な音声指示
対話、物理的な音、雰囲気、音楽を分離します。正確なセリフの前に発言者の名前を付け、セリフが終わるまで十分な時間を残しておきます。例えば:
会話: 黄色いコートを着た女性が「電車はもう来ました」と言います。
物理的な音: 電車のブレーキ音とホームの足音。
雰囲気: 低い駅のざわめきと遠くからのアナウンス。
音楽:BGMはありません。
この分離により、音声障害の分類も容易になります。音声が間違っているが動作は使用可能な場合は、視覚的なプロンプトを維持し、セリフのみを修正します。すべての音が音声と競合する場合は、まず音楽を削除してください。
Seedance 2.5 でよくある 5 つの失敗
ショットが決まる前に被写体が動いてしまう
最初の 0.5 秒または最初の拍の静的な説明で始まります。これにより、アクションが開始される前に、モデルに視覚的な開始点が与えられます。
カメラの動きが多すぎます
ショットごとに 1 つのメイン カメラの動きを使用します。 「周回、傾斜、ズーム、手持ちでのシェイクをしながらドリーイン」は、いくつかの競合する軌道に対する要求です。ストーリーをサポートする動きを選択し、他の動きは別のショットのために取っておきます。
画像からビデオへの結果は参照を再描画します
保護された詳細を記載し、変更点のみを説明します。モーションの振幅を減らし、パーティクル、反射、または劇的な照明の変化などの二次的な影響を除去します。
対話の終了が遅すぎる
インターフェースで許可されている場合は、セリフを短くしたり、早めに話し始めたり、ショット時間を長くしたりしてください。すでに混雑しているプロンプトに「もっと早く話してください」を追加しないでください。そのため、不自然な出産が生じることがよくあります。
エンディングは未完成な感じがする
最終状態を明示的に記述します。被写体はフレームから離れたり、ポーズで止まったり、製品を見せたり、最初の構図に戻ったりすることができます。エンディングがない場合、モデルは最後の数秒を中間アクションの継続に費やす可能性があります。
反復可能な反復ループ
単純な最初のパスを生成し、その後一度に 1 つの変数を変更します。まず被写体の身元と構成を確認します。次にメインアクションが完了したかどうかを確認します。次に、カメラ パス、オーディオ、最終フレームを確認します。結果の横に最適なプロンプトを保存し、正確なモデル、期間、アスペクト比、およびソース イメージのバージョンを記録します。これらのメモは、ある世代のほうが「良く見えた」という漠然とした判断よりも役立ちます。
パブリックの C Dance AI ワークスペースを使用すると、テキストからビデオへのルートで選択された Seedance 2.5 を使用して同じプロンプトをテストできます。参照ワークフローとして、Seedance 2.5 モデル ページ を使用し、事前に選択された Seedance 2.5 ワークスペース を開いて、結果を Seedance 2.0 画像から動画への変換ガイド および マルチショットストーリーボードガイド と比較します。

Seedance 2.5 プロンプトに関するよくある質問
Seedance 2.5 は長いプロンプトを備えた方が優れていますか?
長いプロンプトは、各行に可視または可聴の制約を追加する場合にのみ役立ちます。多くの場合、1 つの明確なアクションを含む短いプロンプトは、複数の無関係なイベントを含む長い段落よりも制御が簡単です。
テキストからビデオへの変換と画像からビデオへの変換のどちらを使用する必要がありますか?
シーンを作成するためにモデルが必要な場合は、テキストからビデオへの変換を使用します。最初のフレームに保存したい主題、レイアウト、製品、またはキャラクター デザインがすでに含まれている場合は、画像からビデオへの変換を使用します。
1 つのプロンプトにはカメラの動きを何回含める必要がありますか?
ショットごとに 1 つのメイン カメラの動きから始めます。ショット リストがタイミングとトランジションを明確に区別している場合にのみ、2 番目の動きを追加します。
製品を読みやすく保つにはどうすればよいですか?
ラベル、形状、位置、照明に保護された詳細として名前を付けます。製品の動きを小さくし、安定したフレームで終了します。小さなテキストでも失敗する可能性があるため、フルサイズで検査するまで、生成されたクリップを下書きとして扱ってください。
会話と音楽を一緒に促すことはできますか?
はい、ただし、それぞれに役割とボリューム関係を割り当てます。会話がメッセージである場合は、それが理解可能なままであると述べ、会話中の音楽を減らすか削除します。
このガイドは特定の結果を保証しますか?
いいえ。これらの例は構造化された出発点であり、管理されたベンチマークではありません。結果は、ソース イメージ、プロンプト、モデル バージョン、期間、生成時に利用可能なインターフェイス設定によって異なります。
実際のルールは単純です。フレームを定義し、読み取り可能なアクションを 1 つ要求し、カメラを制御し、クリップの終了場所を指定します。次に、次の変更を単独でテストします。
そのため、多くの商業チームはアイデア出しのためにテキストからビデオへの変換を使用し、改良のために画像からビデオへの変換を使用しています。

