Gesaan MiniMax H3 berfungsi paling baik sebagai garis masa. Tentukan bingkai pembukaan, tindakan yang boleh dilihat, laluan kamera, bunyi dan keadaan penamat dalam susunan itu. Untuk aliran kerja imej atau rujukan, huraikan perkara yang dikawal oleh setiap input dan bukannya mengulangi butiran yang sudah boleh dilihat oleh model.
Panduan segera MiniMax H3: jawapan pantas
- Struktur segera: bingkai pembukaan, tindakan, tindak balas alam sekitar, kamera, audio dan bingkai akhir.
- Teks-ke-video: tentukan keseluruhan pemandangan kerana tiada imej sumber yang menetapkannya.
- Imej-ke-video: kekalkan butiran tetap dan terangkan hanya perkara yang berubah selepas bingkai satu.
- Rujukan-ke-video: tetapkan satu tugas yang jelas kepada setiap imej, video atau fail audio.
- Audio: dialog berasingan, bunyi fizikal, suasana dan muzik latar.
- Tetapan C Dance AI: 4 hingga 15 saat, dengan output 768P dan 2K.
Contoh di bawah ialah menulis templat dan bukannya hasil penanda aras terkawal. Bahagian komuniti mengenal pasti bahan ujiannya secara berasingan.
Apakah MiniMax H3?
MiniMax H3, juga dikenali sebagai Hailuo 3.0, ialah model video AI yang menjana video dan audio stereo asli daripada rujukan teks dan visual. Panduan ini menggunakan struktur segera rasmi untuk MiniMax H3 dalam C Dance AI.
| Harta benda | Skop artikel semasa |
|---|---|
| Aliran kerja utama | Teks-ke-video, imej-ke-video, bingkai pertama/terakhir dan rujukan-ke-video |
| Panjang pantas dalam C Dance AI | 1 hingga 7,000 aksara |
| Tempoh dalam C Dance AI | Nombor bulat dari 4 hingga 15 saat |
| Resolusi dalam C Dance AI | 768P atau 2K |
| Audio asli | Dialog, suasana, bunyi fizikal dan muzik latar |
| Kontrak rujukan | Sehingga 9 imej, 3 video, 3 fail audio dan 12 fail jumlahnya |
Mod MiniMax H3 manakah yang patut anda gunakan?
| Mod | Apa yang telah ditakrifkan oleh input | Perkara yang mesti ditentukan oleh gesaan | Kesilapan biasa |
|---|---|---|---|
| Teks-ke-video | Tiada apa-apa visual | Komposisi pembuka, subjek, aksi, kamera, bunyi dan pengakhiran | Bermula dengan gerakan sebelum mewujudkan adegan |
| Imej-ke-video | Penampilan dan komposisi bingkai pertama | Butiran dan pergerakan terpelihara selepas bingkai satu | Menulis semula imej dan bukannya menerangkan perubahan |
| Bingkai pertama/terakhir | Keadaan pembukaan dan penamat | Peralihan fizikal antara kedua-dua bingkai | Menghuraikan dua imej pegun tanpa tindakan penghubung |
| Rujukan-ke-video | Identiti, gerakan, gaya atau isyarat masa yang diberikan | Satu peranan setiap aset dan transformasi yang dimaksudkan | Menambah rujukan yang bercanggah antara satu sama lain |
Bagaimanakah gesaan MiniMax H3 harus distrukturkan?
Draf pertama yang berguna menjawab enam soalan mengikut urutan:
- Apakah yang terdapat dalam bingkai pembukaan?
- Apakah yang dilakukan oleh subjek?
- Bagaimanakah persekitaran bertindak balas?
- Di manakah kamera bergerak?
- Apa yang boleh didengari?
- Apakah yang ditunjukkan oleh bingkai akhir?
Untuk klip produk satu tangkapan, itu mungkin menjadi:
Video produk studio aksi langsung. Minuman sitrus sejuk boleh berdiri tegak di atas batu gelap. Aliran air yang sempit mengenai permukaan di sebelah tin, dan percikan melengkung di sekeliling tapaknya manakala pemeluwapan bergerak ke bawah logam. Kamera membuat satu lengkok perlahan mengikut arah jam, mengekalkan label menghadap kanta. Cahaya rim rangup, pantulan terkawal. Pukulan berakhir dengan air mendap dan tin berpusat.
Gesaan menerangkan sebab dan akibat. Air mencecah permukaan, percikan bergerak di sekeliling tin, dan titisan mendap. "Fizik cecair realistik" kurang berguna kerana ia menamakan kualiti yang diingini tanpa menentukan peristiwa.
Buka ruang kerja C Dance AI dengan MiniMax H3 dipilih apabila anda bersedia untuk menguji gesaan.
Bagaimanakah gesaan berubah mengikut mod H3?
H3 menyokong beberapa aliran kerja, dan setiap satu memerlukan maklumat yang berbeza. Mengulang gesaan yang sama merentas setiap mod membazirkan kawalan yang dibekalkan oleh aset input.
Teks-ke-video: tentukan keseluruhan tangkapan
Teks-ke-video tidak mempunyai imej pembukaan untuk menetapkan subjek atau gubahan. Terangkan bingkai awal sebelum tindakan bermula.
Tangkapan aksi langsung, lebar sederhana di dalam kedai roti yang sunyi sebelum matahari terbit. Seorang tukang roti membuka bidai kayu, meletakkan roti hangat di atas kaunter, kemudian memotong satu keping apabila wap naik. Kamera menolak perlahan ke arah roti tanpa mengubah ketinggian. Suasana jalanan kekal samar di sebalik goresan bidai dan potongan rangup melalui kerak. Gitar akustik lembut dimainkan di bawah tempat kejadian. Berakhir dengan pandangan dekat roti yang dihiris.
Simpan konkrit pembukaan: pembingkaian, kedudukan subjek, tetapan, dan cahaya. Gesaan yang bermula dengan pergerakan tetapi tidak pernah mewujudkan adegan memaksa model membuat keputusan terlalu banyak sekaligus.
Imej-ke-video: terangkan perkara yang berubah selepas bingkai satu
Imej yang dimuat naik sudah membekalkan rupa dan gubahan. Jangan menghabiskan separuh gesaan mengulangi setiap butiran yang kelihatan. Kenal pasti perkara yang mesti kekal, kemudian terangkan pergerakan seterusnya.
Gunakan imej yang dimuat naik sebagai bingkai pembukaan yang tepat. Pelihara muka wanita, kardigan biru, rantai perak, kedudukan tempat duduk, dan susun atur gerabak kereta api. Dia mengangkat pandangannya dari surat yang dilipat ke arah tingkap yang dilitupi hujan, kemudian melipat kertas itu di sepanjang lipatan sedia ada. Kamera bergerak perlahan ke kanan manakala pantulannya melintasi kaca. Hujan mengetuk tingkap di atas rentak rendah roda kereta api. Tiada muzik latar belakang.
Jika anda menyediakan kedua-dua bingkai pertama dan terakhir, huraikan laluan fizikal di antara mereka. Elakkan menulis dua huraian imej statik. Terangkan bagaimana pose, objek, kamera dan cahaya bergerak dari keadaan pembukaan ke keadaan akhir.
Rujukan-ke-video: berikan setiap aset satu pekerjaan
Kontrak pembekal H3 yang disambungkan ke C Dance AI menyokong sehingga sembilan imej, tiga video dan tiga fail audio, dengan jumlah 12 fail. Ruang kerja awam pada masa ini mendedahkan teks-ke-video dan imej-ke-video; kawalan rujukan penuh bergantung pada antara muka yang tersedia apabila anda menjana. Lebih banyak rujukan tidak menjamin kesinambungan yang lebih baik. Setiap fail harus menyelesaikan ketidakpastian tertentu.
Gunakan peranan rujukan seperti:
- Imej 1 mentakrifkan muka dan rambut orang itu.
- Imej 2 mentakrifkan pakaian dan palet warna.
- Video 1 membekalkan pergerakan badan dan irama kamera.
- Audio 1 membekalkan rujukan suara atau masa.
Kemudian tuliskan transformasi secara langsung:
Gunakan orang daripada Imej 1 sebagai satu-satunya penghibur. Kekalkan proporsi mukanya, rambut hitam pendek dan jaket merah. Ikuti pergerakan badan dan pemasaan tangkapan daripada Video 1, tetapi letakkan aksi dalam platform kereta api bawah tanah yang ditunjukkan dalam Imej 2. Kekalkan laluan kamera dan urutan pose pemain daripada Video 1. Gunakan Audio 1 untuk pemasaan; jangan tambah muzik latar belakang.
Rujukan yang bercanggah adalah sumber yang biasa hanyut. Jika dua imej menunjukkan pakaian atau bentuk muka yang berbeza, H3 mesti memutuskan butiran yang perlu disimpan. Alih keluar rujukan yang lebih lemah sebelum menambah lebih banyak teks gesaan.
Apakah yang ditunjukkan oleh ujian H3 komuniti?
Peraturan segera rasmi menerangkan sintaks. Ujian komuniti menunjukkan pembolehubah yang patut disemak awal.
Satu penanda aras awam mengumpulkan 1,000 generasi H3 merentas banyak subjek dan gaya. Grid sampelnya meliputi muka, tipografi, orang ramai, sentuhan fizikal, animasi, pergerakan kamera dan adegan biasa. Julat itu memberikan lebih banyak bukti daripada satu klip yang menarik, sementara masih memerlukan output individu untuk diperiksa untuk kegagalan.

Pelbagai jenis boleh menyembunyikan kegagalan individu. Untuk penilaian berfokus, simpan input, tempoh, mod, resolusi dan satu pembolehubah yang diubah di sebelah setiap percubaan.
Ujian rujukan-ke-video komuniti yang berasingan menggabungkan rujukan watak, persekitaran dan objek dalam satu adegan bergerak. Dua imej mentakrifkan pemain, satu mentakrifkan suasana gunung, dan satu mentakrifkan basikal. Peranan tersebut menghilangkan empat kekaburan visual daripada gesaan generik untuk "dua watak anime menunggang basikal."
Pengguna Reddit irmemon225 mencipta sampel aliran kerja rujukan ini. Ia mendokumenkan satu output daripada satu set rujukan; ia tidak menetapkan kadar kejayaan purata.
Ujian komuniti kedua menggunakan peleraian rendah dan kiraan langkah yang rendah untuk memperhalusi gesaan sebelum pemaparan akhir. Draf pas menyemak kiraan subjek, arah kamera, peranan rujukan dan susunan tangkapan. Tingkatkan kualiti selepas elemen tersebut stabil.
Bagaimanakah gerakan kamera harus ditulis?
Pilih satu laluan kamera yang dominan untuk syot pendek. H3 memahami pergerakan seperti tolak masuk, tarik keluar, pan, trak, senget, alas, arka, penjejakan, pembingkaian statik, goncang, sudut pandangan, zum dan guling.
Tulis pergerakan di dalam tempat kejadian:
Kamera menjejak di sebelah penunggang basikal di aras jalan sambil mengekalkan jarak yang sama.
Elakkan timbunan label seperti:
kamera dinamik, pukulan dron, orbit, kuali cambuk, zum, fokus rak
Arahan tersebut bersaing untuk saat yang sama. Jika tangkapan memerlukan pendedahan, nyatakan pandangan permulaan, pergerakan dan perkara yang didedahkan oleh kamera:
Pukulan dekat bermula pada tepung yang menutupi tangan tukang roti. Kamera ditarik ke belakang perlahan-lahan, mendedahkan meja kerja penuh dan enam roti siap sementara tukang roti terus menguli.
Gunakan potongan hanya apabila pukulan seterusnya menyumbang maklumat baharu. Perubahan sedikit dalam jarak biasanya lebih baik dikendalikan oleh gerakan kamera.
Bagaimanakah anda menulis gesaan H3 berbilang tangkapan?
Klip 6 saat tidak boleh membawa cerita yang sama seperti klip 15 saat. Tetapkan masa untuk setiap rentak sebelum menambah perincian.
Iklan produk 10 saat ini menggunakan tiga tangkapan:
[Shot 1] Komersial aksi langsung, pandangan dekat seorang pelari mengikat satu kasut di trek basah sebelum subuh. Kamera kekal rendah dan statik. Kain ditarik ketat dan renda diselak lembut.
[Pukulan 2] Pada pukul 00:03.000, potong ke pukulan menjejak sisi semasa pelari memecut melalui selekoh pertama. Setiap jejak melemparkan semburan kecil dari trek. Hentakan pernafasan dan kaki meningkat di atas suasana bandar yang jauh.
[Pukulan 3] Pada 00:07.000, potong ke pendaratan kasut di sebelah garisan penamat, kemudian tolak masuk perlahan-lahan apabila pelari berhenti. Denyutan bass pendek berakhir dengan langkah terakhir.
Masa pemotongan meninggalkan tiga saat untuk persediaan, empat untuk aksi utama, dan tiga untuk penamat. Jika dialog ditambah, ia mesti sesuai dalam belanjawan yang sama.
Jangan tambah cap masa pada setiap pergerakan dalam satu tangkapan berterusan. Gunakannya untuk menandakan pemotongan yang berbeza atau acara bermasa penting.
Bagaimanakah anda menggesa dialog dan audio asli?
H3 menjana video dan bunyi stereo asli bersama-sama. Gesaan menjadi lebih mudah dikawal apabila ia membezakan tiga lapisan audio:
- Dialog: perkataan tepat yang diucapkan oleh orang yang dikenal pasti.
- Soundscape: suasana, tapak kaki, hentaman, fabrik, hujan, pernafasan atau jentera.
- Muzik latar: muzik yang didengari oleh penonton tetapi bukan oleh orang di tempat kejadian.
Untuk dua penceramah, pastikan identiti mereka stabil:
[Shot 1] Aksi langsung, syot sederhana dalam petak kereta api kecil. Wanita di tepi tingkap, bercakap dengan lembut (Speaker 1), berkata dalam bahasa Inggeris: "Saya turun di stesen seterusnya." Konduktor di pintu, dengan suara perlahan (Speaker 2), membalas dalam bahasa Inggeris: "Kami tiba dalam dua minit." Mulut mereka hanya bergerak semasa talian mereka sendiri.
Soundscape: Bunyi roda yang stabil, hujan renyai terhadap kaca dan satu pukulan tiket lembut.
Muzik latar belakang: Nota piano jarang pada tempo perlahan, pudar sebelum konduktor membalas.
Pastikan salinan pertuturan pendek. Baca dengan kuat dengan pemasa. Jika ayat mengambil masa lima saat untuk disebut, ayat itu tidak boleh muat secara semula jadi di sebelah baris lain dan beberapa tindakan dalam video 6 saat.
Untuk alih suara, katakan bahawa ia di luar skrin dan bibir subjek pada skrin kekal tertutup. Ini mengurangkan peluang bahawa H3 memberikan narasi kepada watak yang boleh dilihat.
Contoh segera MiniMax H3 yang manakah boleh anda sesuaikan?
Gesaan ini meliputi masalah pengeluaran yang berbeza. Gantikan butiran subjek dan jenama, tetapi kekalkan logik tindakan.
Demonstrasi pencipta menegak
Video telefon aksi langsung menegak di apartmen yang terang. Seorang wanita menghadap kanta sambil memegang vakum pegang tangan padat di tangan kanannya. Dia menunjuk ke muncung dengan jari telunjuk kirinya, membongkok ke arah sofa, dan mengeluarkan satu garisan serbuk dalam satu laluan. Kamera mempunyai pergerakan pegang tangan yang ringan tetapi mengekalkan tangannya dan produk dalam bingkai. Cahaya tingkap semulajadi. Motor dihidupkan apabila muncung sampai ke sofa, kemudian berhenti di hujungnya. Tiada potongan dan tiada muzik latar belakang.
Animasi fesyen bingkai pertama
Gunakan potret yang dimuat naik sebagai bingkai pertama yang tepat. Pelihara muka model, rambut bertocang, kot hijau, dan kedudukan jalan di belakangnya. Dia memusingkan bahunya ke arah jalan, mengambil dua langkah yang diukur, dan menoleh ke belakang ke bahu kirinya. Kamera menjejak ke belakang pada kelajuan berjalan dan mengekalkan komposisi badan penuh. Angin menggerakkan labuh kot ke arah yang sama dengan gilirannya. Tamat dengan wajahnya kelihatan dalam profil tiga suku.
Adegan aksi fizikal
Tangkapan seluruh badan aksi langsung di gudang kosong. Seorang pemain lagak ngeri berlari ke arah penghadang kayu rendah, menanam kedua-dua kaki, membersihkannya, mendarat dengan lutut bengkok, berguling di atas bahu kanan, dan bangkit untuk berlari. Debu naik pada hentaman dan mendap di belakangnya. Sebuah kamera pegang tangan yang stabil mengikuti dari belakang tiga meter tanpa memintasnya. Cahaya sisi keras melalui tingkap tinggi. Satu pukulan berterusan dengan tapak kaki, pergerakan pakaian, kesan pendaratan dan tanpa muzik.
Penggantian aksara yang diterajui rujukan
Gunakan Video 1 sebagai sumber untuk pemasaan tangkapan, sudut kamera, pergerakan badan dan tindakan latar belakang. Gantikan hanya pelaku dalam Video 1 dengan orang yang ditakrifkan oleh Imej 1. Kekalkan bahagian muka, rambut, pakaian dan badan daripada Imej 1 sepanjang klip. Pastikan setiap orang, objek, pergerakan kamera dan bunyi persekitaran daripada Video 1 tidak berubah. Jangan salin latar belakang daripada Imej 1.
Contoh terakhir memerlukan mod Rujukan. Gesaan imej-ke-video biasa tidak mempunyai masa dan gerakan video sumber untuk disimpan.
Mengapakah MiniMax H3 mengabaikan arahan segera?
Apabila output gagal, tukar arahan terkecil yang menerangkan kegagalan.
| Kegagalan | Kemungkinan masalah segera | Semakan pertama |
|---|---|---|
| Pemotongan rawak | Beberapa gerakan kamera atau perubahan adegan bersaing | Minta satu tangkapan berterusan dan satu laluan kamera |
| Salah orang cakap | Penceramah tidak dikenal pasti secara konsisten | Berikan setiap pembesar suara label yang stabil dan pendekkan pertukaran |
| Dialog menjadi tergesa-gesa | Talian terlalu panjang untuk tempoh tersebut | Masa garis dengan kuat atau tambah panjang klip |
| Produk berubah bentuk | Aksi, kamera dan penggayaan membebankan syot | Kunci orientasi produk dan keluarkan gerakan sekunder |
| Identiti rujukan melayang | Rujukan bercanggah atau mempunyai peranan yang tidak jelas | Kekalkan imej identiti yang paling jelas dan nyatakan setiap baki peranan |
| Bingkai pertama dan terakhir tidak bersambung | Peralihan fizikal tiada | Terangkan pose pertengahan, objek dan perubahan kamera |
| Bunyi terasa tidak berkaitan | Audio dinyatakan hanya sebagai mood | Namakan sumber, masa dan perubahan volum |
Jangan tulis semula keseluruhan gesaan selepas setiap kegagalan. Jika kamera salah tetapi subjek kekal konsisten, kekalkan bahasa subjek dan semak semula ayat kamera. Ini menjadikan setiap percubaan semula bermaklumat.
Tempoh dan resolusi yang manakah harus anda pilih?
Penyepaduan C Dance AI semasa menerima tempoh nombor bulat dari 4 hingga 15 saat. Ia menawarkan output 768P dan 2K, dan lalai ialah generasi 2K 6 saat.
Pengiraan kredit asas semasa:
| Tetapan | Kredit |
|---|---|
| 768P | 50 sesaat keluaran |
| 2K | 80 sesaat keluaran |
| Setiap imej rujukan selepas lima yang pertama | 25 kredit tambahan |
Oleh itu, penjanaan teks ke video 6 saat bermula pada 300 kredit dalam 768P atau 480 kredit dalam 2K. Di bawah kontrak rujukan, tempoh video rujukan dan imej rujukan tambahan boleh meningkatkan jumlahnya. Ruang kerja menunjukkan pengiraan sebelum penyerahan.
Draf pada tempoh paling singkat yang boleh mengadakan aksi dan dialog. Gunakan 768P untuk ujian gubahan awal apabila butiran akhir belum menjadi soalan. Beralih ke 2K selepas pemasaan gesaan dan gelagat kamera stabil.
Apakah yang perlu anda semak sebelum menjana?
Baca gesaan sekali dan sahkan:
- Bingkai pembukaan adalah jelas.
- Klip itu mempunyai satu tindakan utama.
- Sebab dan kesan yang boleh dilihat kedua-duanya diterangkan.
- Arahan kamera tidak bercanggah.
- Potongan sesuai dalam tempoh yang dipilih.
- Setiap penceramah dan rujukan mengekalkan satu identiti.
- Dialog boleh diucapkan dalam masa.
- Suasana dan muzik mempunyai pekerjaan yang berasingan.
- Keadaan akhir boleh dilihat dan boleh dicapai.
Kemudian kembali ke laman utama C Dance AI atau buka Workspace dengan MiniMax H3 yang telah dipilih. Simpan prompt dan tetapan bagi setiap percubaan, catat kegagalan dengan jelas dan ubah satu pembolehubah sahaja sebelum mencuba semula.
Soalan Lazim segera MiniMax H3
Apakah yang perlu disertakan dengan gesaan MiniMax H3?
Mulakan dengan subjek dan tindakan yang boleh dilihat, kemudian tentukan tetapan, laluan kamera, susunan tangkapan, dialog, bunyi fizikal dan muzik latar belakang yang diperlukan klip. Pastikan setiap arahan serasi dengan tempoh yang dipilih.
Berapa lama video MiniMax H3 boleh berada dalam C Dance AI?
Penyepaduan C Dance AI semasa menerima tempoh nombor bulat dari 4 hingga 15 saat dan menawarkan output 768P dan 2K.
Adakah MiniMax H3 menjana audio?
ya. MiniMax H3 boleh menjana audio stereo asli dengan video. Gesaan boleh mengarahkan dialog, suasana, kesan bunyi fizikal dan muzik latar belakang.
Bolehkah MiniMax H3 menggunakan rujukan imej, video dan audio?
Kontrak pembekal H3 menyokong rujukan imej, video dan audio. C Dance AI pada masa ini mendedahkan teks-ke-video dan imej-ke-video dalam ruang kerja awam; kawalan rujukan penuh bergantung pada antara muka yang tersedia apabila anda menjana.
Bagaimanakah saya harus menggesa dialog dalam MiniMax H3?
Kenal pasti setiap penutur secara konsisten, tulis baris pertuturan yang tepat, nyatakan bahasa dan biarkan masa yang cukup untuk baris itu. Asingkan dialog daripada suasana dan muzik latar supaya peranan mereka kekal jelas.
Mengapakah MiniMax H3 mengabaikan bahagian gesaan?
Gesaan mungkin mengandungi terlalu banyak tindakan, pergerakan kamera yang bercanggah, peranan rujukan yang tidak jelas atau lebih banyak dialog daripada yang boleh dimuatkan oleh klip. Alih keluar arahan kedua dan uji satu perubahan pada satu masa.

