MiniMax H3 プロンプトはタイムラインとして最適に機能します。開始フレーム、表示されるアクション、カメラ パス、サウンド、終了状態をこの順序で定義します。画像または参照ワークフローの場合は、モデルがすでに確認している詳細を繰り返すのではなく、各入力が何を制御するかを説明します。
MiniMax H3 プロンプト ガイド: クイックアンサー
- プロンプト構造: 開始フレーム、アクション、環境応答、カメラ、オーディオ、および最終フレーム。
- テキストからビデオへ: ソース画像が確立されていないため、シーン全体を定義します。
- 画像からビデオへ: 固定された詳細を保持し、フレーム 1 の後に変更された内容のみを記述します。
- ビデオへの参照: 各画像、ビデオ、またはオーディオ ファイルに 1 つのクリア ジョブを割り当てます。
- オーディオ: 個別のダイアログ、物理的な音、雰囲気、BGM。
- C Dance AI 設定: 4 ~ 15 秒、768P および 2K 出力。
以下の例は、制御されたベンチマーク結果ではなく、テンプレートを作成しています。コミュニティセクションでは、テスト内容を個別に特定します。
MiniMax H3とは何ですか?
MiniMax H3 (別名 Hailuo 3.0) は、テキストとビジュアル参照からビデオとネイティブ ステレオ オーディオを生成する AI ビデオ モデルです。このガイドでは、公式のプロンプト構造を C Dance AI の MiniMax H3 に適用します。
| 財産 | 現在の記事の範囲 |
|---|---|
| 主なワークフロー | テキストからビデオへ、画像からビデオへ、最初/最後のフレーム、およびビデオへの参照 |
| C Dance AI のプロンプトの長さ | 1~7,000文字 |
| 期間 (C Dance AI) | 4 ~ 15 秒の整数 |
| C Dance AI の解像度 | 768Pまたは2K |
| ネイティブオーディオ | 会話、雰囲気、物理的な音、BGM |
| 参照契約 | 画像9点、動画3点、音声3点、合計12ファイルまで |
どの MiniMax H3 モードを使用する必要がありますか?
| モード | 入力ですでに定義されているもの | プロンプトで定義する必要があるもの | よくある間違い |
|---|---|---|---|
| テキストからビデオへ | 視覚的なものは何もない | オープニングの構成、主題、アクション、カメラ、サウンド、エンディング | シーンを確立する前のモーションから始める |
| 画像からビデオへ | 外観と最初のフレーム構成 | フレーム 1 以降の保持された詳細と動き | 変化を説明する代わりにイメージを書き換える |
| 最初/最後のフレーム | 開始状態と終了状態 | 両方のフレーム間の物理的な移行 | 接続アクションを伴わない 2 つの静止画の記述 |
| ビデオへの参照 | 割り当てられたアイデンティティ、モーション、スタイル、またはタイミング キュー | 資産ごとに 1 つの役割と意図した変換 | 互いに競合する参照の追加 |
MiniMax H3 プロンプトはどのように構成すればよいですか?
役立つ初稿は、6 つの質問に順番に答えます。
- オープニングフレームには何が入っていますか?
- 被験者は何をしますか?
- 環境はどのように反応するのでしょうか?
- カメラはどこに移動しますか?
- 何が聞こえるでしょうか?
- 最後のフレームには何が表示されますか?
シングルショットの製品クリップの場合、次のようになります。
実写スタジオの製品ビデオ。冷たい柑橘類の飲み物の缶が暗い石の上に直立しています。細い水流が缶の横の表面に当たり、水しぶきが缶の底の周りでカールし、結露が金属の下に移動します。カメラはゆっくりと時計回りに弧を描き、ラベルをレンズに向けたままにします。反射を抑えた鮮明なリムライト。水が落ち着き、缶が中心に置かれた状態でショットは終了します。
プロンプトには原因と結果が説明されます。水が表面に当たり、水しぶきが缶の周りを動き、水滴が沈みます。 「現実的な液体物理学」は、イベントを定義せずに望ましい品質に名前を付けるため、あまり有用ではありません。
プロンプトをテストする準備ができたら、MiniMax H3 を選択した状態で C Dance AI ワークスペースを開きます。
H3 モードによってプロンプトはどのように変化しますか?
H3 は複数のワークフローをサポートしており、それぞれに異なる情報が必要です。すべてのモードで同じプロンプトを繰り返すと、入力アセットによって提供される制御が無駄になります。
テキストからビデオへ: ショット全体を定義する
Text-to-Video には、主題や構成を確立するための開始画像がありません。アクションが始まる前の最初のフレームについて説明します。
日の出前の静かなパン屋内での実写、中広角ショット。パン屋は木製の雨戸を開け、温かいパンをカウンターに置き、蒸気が立ち上る中、一枚ずつ切り分けます。カメラは高さを変えずにゆっくりとパンに向かって押していきます。通りの雰囲気は、シャッターの擦れる音や地殻を切り裂く鮮明な音の背後にかすかに残っています。柔らかなアコースティックギターが下で演奏されます。最後はスライスされたパンを間近で見てみましょう。
フレーム、被写体の位置、設定、光など、開口部を具体的に保ちます。動きから始まるがシーンを確立しないプロンプトでは、モデルは一度に多くのことを決定する必要があります。
画像からビデオへ: フレーム 1 の後に何が変わるかを説明します
アップロードされた画像には、すでに外観と構成が含まれています。プロンプトの半分を費やして、目に見える詳細をすべて繰り返す必要はありません。何を修正しなければならないかを特定し、次の動きを説明します。
アップロードした画像を正確な開始フレームとして使用します。女性の顔、青いカーディガン、銀のネックレス、座席の位置、車両のレイアウトを保存します。彼女は折り畳んだ手紙から雨に覆われた窓に視線を移し、折り目に沿って紙を折ります。カメラはゆっくりと右に移動し、彼女の反射がガラスを横切ります。電車の車輪の低いリズムに合わせて、雨が窓を叩きます。バックグラウンドミュージックはありません。
最初と最後のフレームの両方を指定する場合は、それらの間の物理パスを記述します。 2 つの静的イメージの説明を記述することは避けてください。ポーズ、オブジェクト、カメラ、ライトが開始状態から終了状態にどのように移動するかを説明します。
ビデオへの参照: すべてのアセットに 1 つのジョブを与える
C Dance AI に接続された H3 プロバイダー契約は、最大 9 つの画像、3 つのビデオ、3 つの音声ファイル (合計 12 ファイル) をサポートします。パブリック ワークスペースは現在、テキストからビデオへの変換と画像からビデオへの変換を公開しています。完全参照コントロールは、生成時に使用可能なインターフェイスに依存します。参照の数が増えても、より良い連続性が保証されるわけではありません。各ファイルは特定の不確実性を解決する必要があります。
次のような参照ロールを使用します。
- 画像 1 は人物の顔と髪を定義します。
- 画像 2 は衣装とカラー パレットを定義します。
- ビデオ 1 は体の動きとカメラのリズムを提供します。
- オーディオ 1 は音声またはタイミング基準を供給します。
次に、変換を直接記述します。
画像 1 の人物を唯一の出演者として使用します。彼女の顔のプロポーション、短い黒髪、赤いジャケットを維持します。ビデオ 1 の体の動きとショットのタイミングに従いますが、画像 2 に示す地下鉄のプラットフォームにアクションを配置します。ビデオ 1 のカメラ パスとパフォーマーのポーズ シーケンスを維持します。タイミングにはオーディオ 1 を使用します。バックグラウンドミュージックを追加しないでください。
競合する参照は、ドリフトの一般的な原因です。 2 つの画像に異なる服装や顔の形が表示されている場合、H3 はどちらの詳細を保持するかを決定する必要があります。プロンプト テキストを追加する前に、弱い参照を削除してください。
コミュニティ H3 テストは何を示しますか?
公式のプロンプト ルールで構文が説明されています。コミュニティ テストでは、どの変数が早期チェックに値するかを示します。
1 つの公開ベンチマークでは、さまざまな主題とスタイルにわたって 1,000 の H3 世代が集められました。そのサンプル グリッドは、顔、タイポグラフィー、群衆、物理的接触、アニメーション、カメラの動き、および通常のシーンをカバーしています。この範囲では、単一の魅力的なクリップよりも多くの証拠が提供されますが、それでも個々の出力に障害がないか検査する必要があります。

多様性があれば、個々の失敗が隠れてしまう可能性があります。焦点を絞った評価を行うには、各試行の横に入力、期間、モード、解像度、および 1 つの変更された変数を保持します。
別のコミュニティ参照とビデオのテストでは、キャラクター、環境、オブジェクトの参照を 1 つの動くシーンに組み合わせました。 2 つの画像は出演者を定義し、1 つは山の風景を定義し、もう 1 つは自転車を定義します。これらの役割は、「自転車に乗っている 2 人のアニメ キャラクター」という一般的なプロンプトから 4 つの視覚的な曖昧さを取り除きます。
Reddit ユーザー irmemon225 がこのリファレンス ワークフロー サンプルを作成しました。 1 つのリファレンス セットからの 1 つの出力を文書化します。平均的な成功率を確立するものではありません。
2 番目のコミュニティ テストでは、低解像度と低いステップ数を使用して、最終レンダリングの前にプロンプトを調整しました。ドラフト パスでは、被写体の数、カメラの方向、参照役割、撮影順序がチェックされます。これらの要素が安定してから品質を高めます。
カメラモーションはどのように書けばいいのでしょうか?
ショート ショットに対して支配的なカメラ パスを 1 つ選択します。 H3 は、押し込む、引き出す、パン、トラック、チルト、台座、円弧、トラッキング、静的フレーミング、シェイク、視点、ズーム、ロールなどの動きを理解します。
シーン内の動きを書きます。
カメラは同じ距離を保ちながら、道路レベルでサイクリストの横を追跡します。
次のようなラベルのスタックは避けてください。
ダイナミック カメラ、ドローン ショット、オービット、ホイップ パン、ズーム、ラック フォーカス
これらの命令は同じ秒間で競合します。ショットに明らかにする必要がある場合は、開始時のビュー、動き、カメラが何を明らかにするかを述べます。
パン屋の手を覆う小麦粉からクローズショットが始まります。カメラはゆっくりと後退し、パン職人がこね続けている間、作業台全体と完成した 6 つのパンが表示されます。
次のショットが新しい情報を提供する場合にのみカットを使用します。距離のわずかな変化は通常、カメラの動きによってうまく処理されます。
マルチショット H3 プロンプトはどのように作成しますか?
6 秒のクリップは、15 秒のクリップと同じストーリーを伝えることはできません。ディテールを追加する前に、各ビートに時間を割り当てます。
この 10 秒の商品広告では、次の 3 つのショットが使用されています。
[ショット 1] 実写のコマーシャル。夜明け前の濡れた路面で片方の靴の紐を結ぶランナーのクローズアップビュー。カメラは低い位置で静止したままになります。生地はしっかりと引っ張られ、レースは柔らかくスナップされます。
[ショット 2] 00:03.000 で、ランナーが最初のカーブを通過して加速するときに、サイド トラッキング ショットにカットします。足音が踏むたびに、線路から小さな水しぶきが飛び散ります。呼吸と足の衝撃が、遠く離れた街の雰囲気を超えて高まります。
[ショット 3] 00:07.000、ゴール横のシューズの着地までカットし、ランナーが停止するのに合わせてゆっくりと押し込みます。短い低音パルスは最後の足音で終わります。
カットタイムはセットアップに 3 秒、メインアクションに 4 秒、フィニッシュに 3 秒かかります。対話を追加する場合は、同じ予算内に収める必要があります。
単一の連続ショット内のすべての動きにタイムスタンプを追加しないでください。これらを使用して、個別のカットや重要な時間指定されたイベントをマークします。
対話とネイティブ音声をどのように促すのですか?
H3 はビデオとネイティブ ステレオ サウンドを一緒に生成します。次の 3 つのオーディオ レイヤーを区別すると、プロンプトの制御が容易になります。
- 対話: 特定された人物が話した正確な言葉。
- サウンドスケープ: 雰囲気、足音、衝撃、布地、雨、呼吸、または機械。
- バックグラウンドミュージック: 観客には聞こえるが、シーン内の人々には聞こえない音楽。
2 人の話者の場合、そのアイデンティティを安定させます。
[ショット 1] 実写、小さな電車の車室でのミディアムショット。窓際の女性は穏やかな声で(話者 1)、英語で「次の駅で降ります。」と言いました。ドアの車掌は、低い声で (スピーカー 2)、「2 分で到着します。」と英語で答えます。彼らの口は自分のセリフの間だけ動きます。
サウンドスケープ: 安定したホイールノイズ、ガラスに当たる小雨、そして 1 枚の柔らかいチケットパンチ。
BGM: 遅いテンポでまばらなピアノの音、指揮者が応答する前に消えます。
音声コピーは短くしてください。タイマーを使って読み上げます。 1 つの文を言うのに 5 秒かかる場合、その文は 6 秒のビデオ内の別の行やいくつかのアクションの横に自然に収まりません。
ナレーションの場合は、画面外にあり、画面上の対象者の唇は閉じたままであると伝えます。これにより、H3 が表示されている文字にナレーションを割り当てる可能性が低くなります。
どの MiniMax H3 プロンプトの例を適応できますか?
これらのプロンプトは、さまざまな運用上の問題をカバーします。件名とブランドの詳細を置き換えますが、アクション ロジックは保持します。
垂直クリエイターのデモンストレーション
明るいアパートでの縦型実写電話ビデオ。女性は右手にコンパクトな手持ち掃除機を持ち、レンズに向かっています。彼女は左手の人差し指でノズルを指し、ソファに向かってかがみ、一度に一列のパンくずを取り除きます。カメラは手持ちで軽く動きますが、手と製品をフレーム内に保ちます。自然な窓の光。ノズルがソファに到達するとモーターが始動し、最後に停止します。カットもBGMもありません。
最初のフレームのファッションアニメーション
アップロードされたポートレートを正確な最初のフレームとして使用します。モデルの顔、三つ編みの髪、緑のコート、後ろの通りの位置を保存します。彼女は肩を道路に向け、測りながら二歩歩き、左肩越しに振り返った。カメラは歩く速度で後方を追跡し、全身の構図を保ちます。風が彼女のターンと同じ方向にコートの裾を動かします。彼女の顔が 4 分の 3 の横顔で見える状態で終わります。
肉体的なアクションシーン
誰もいない倉庫での実写全身ショット。スタントパフォーマーは、低い木製の柵に向かって走り、両足を踏み込んで柵を乗り越え、膝を曲げて着地し、右肩を転がって立ち上がり、走り始めます。衝撃で粉塵が舞い上がり、彼の後ろにたまる。安定した手持ちカメラが彼を追い越すことなく3メートル後方から追いかける。高い窓からの側面光。足音、衣服の動き、着地の衝撃を含む 1 つの連続ショット。音楽はありません。
参照主導の文字置換
ビデオ 1 をショットのタイミング、カメラ アングル、体の動き、背景アクションのソースとして使用します。ビデオ 1 の出演者のみを、画像 1 で定義された人物に置き換えます。クリップ全体を通じて、画像 1 の顔、髪、衣服、体のプロポーションを維持します。ビデオ 1 の他のすべての人物、物体、カメラの動き、環境音は変更されません。画像 1 の背景をコピーしないでください。
最後の例にはリファレンス モードが必要です。通常の画像からビデオへのプロンプトには、保存するソース ビデオのタイミングとモーションがありません。
MiniMax H3 がプロンプトの指示を無視するのはなぜですか?
出力が失敗した場合は、失敗を説明する最小の命令を変更します。
| 失敗 | すぐに発生する可能性のある問題 | 最初の改訂版 |
|---|---|---|
| ランダムカット | いくつかのカメラの動きやシーンの変更が競合します | 1 つの連続ショットと 1 つのカメラ パスをリクエストします |
| 話す人を間違えています | 発言者が一貫して特定されていない | 各発言者に安定したラベルを割り当て、交換を短縮します。 |
| 対話が急ぐようになる | 列が長すぎます | セリフのタイミングを合わせて声に出して聞くか、クリップの長さを長くしてください |
| 製品の形状が変化する | アクション、カメラ、スタイリングがショットに負荷をかけすぎます | 製品の向きをロックし、二次動作を削除します |
| 参照アイデンティティのドリフト | 参照が競合しているか、役割が不明瞭です | 最も明確なアイデンティティイメージを維持し、残りの役割をそれぞれ明記する |
| 最初と最後のフレームが繋がらない | 物理的なトランジションが欠落している | 中間のポーズ、オブジェクト、カメラの変化を説明する |
| 音が無関係に感じられる | オーディオは気分としてのみ表現されます | ソース、タイミング、音量の変化に名前を付けます |
失敗するたびにプロンプト全体を書き直さないでください。カメラが間違っていても主題が一貫している場合は、主題の言語を維持し、カメラの文章を修正します。これにより、各再試行が有益になります。
どの期間と解像度を選択する必要がありますか?
現在の C Dance AI 統合では、4 ~ 15 秒の整数の期間を受け入れます。 768P および 2K 出力を提供し、デフォルトは 6 秒の 2K 生成です。
現在の基本クレジットの計算:
| 設定 | クレジット |
|---|---|
| 768P | 出力 1 秒あたり 50 |
| 2K | 出力 1 秒あたり 80 |
| 最初の 5 つの後の各参照画像 | 25 追加クレジット |
したがって、6 秒のテキストからビデオへの生成は、768P の場合は 300 クレジット、2K の場合は 480 クレジットから始まります。参照契約では、参照ビデオの再生時間と追加の参照画像により合計が増加する可能性があります。ワークスペースには、送信前の計算が表示されます。
アクションと対話を保持できる最短の期間でドラフトを作成します。最終的な詳細がまだ問題になっていない初期の構成テストには 768P を使用します。プロンプトのタイミングとカメラの動作が安定したら、2K に移動します。
生成する前に何を確認する必要がありますか?
プロンプトを一度読んで、次のことを確認します。
- 開口部のフレームは透明です。
- クリップには主なアクションが 1 つあります。
- 原因と目に見える影響の両方が説明されています。
- カメラの命令は競合しません。
- カットは選択したデュレーション内に収まります。
- 各講演者と参照者は 1 つのアイデンティティを保持します。
- 対話は時間内に話すことができます。
- アンビエンスと音楽は別の役割を果たします。
- 終了状態は表示され、達成可能です。
次に、C Dance AI ホームに戻るか、MiniMax H3 が選択された Workspaceで生成します。試行ごとにプロンプトと設定を保存し、失敗を明確に記録して、再試行前に変更する変数を 1 つに絞ります。
MiniMax H3 プロンプト FAQ
MiniMax H3 プロンプトには何を含める必要がありますか?
主題と目に見えるアクションから始めて、クリップに必要な設定、カメラ パス、ショットの順序、ダイアログ、物理的なサウンド、BGM を定義します。各命令は、選択した期間と互換性を保ちます。
MiniMax H3 ビデオは C Dance AI にどれくらいの長さがありますか?
現在の C Dance AI 統合は、4 ~ 15 秒の整数の継続時間を受け入れ、768P および 2K 出力を提供します。
MiniMax H3 はオーディオを生成しますか?
はい。 MiniMax H3 はビデオとともにネイティブ ステレオ オーディオを生成できます。プロンプトは、ダイアログ、雰囲気、物理的な音響効果、BGM を指示できます。
MiniMax H3 は画像、ビデオ、オーディオの参照を使用できますか?
H3 プロバイダー契約は、画像、ビデオ、およびオーディオの参照をサポートします。 C Dance AI は現在、パブリック ワークスペースでテキストからビデオへの変換と画像からビデオへの変換を公開しています。完全参照コントロールは、生成時に使用可能なインターフェイスに依存します。
MiniMax H3 で対話を促すにはどうすればよいですか?
各話者を一貫して識別し、正確なセリフを書き、言語を指定し、セリフのために十分な時間を確保します。会話を雰囲気やBGMから切り離して、役割を明確に保ちます。
MiniMax H3 がプロンプトの一部を無視するのはなぜですか?
プロンプトには、アクションが多すぎたり、カメラの動きが矛盾していたり、参照役割が不明瞭であったり、クリップに収まりきらないほど多くのダイアログが含まれている可能性があります。二次的な命令を削除し、一度に 1 つの変更をテストします。

