Las indicaciones de MiniMax H3 funcionan mejor como líneas de tiempo. Defina el fotograma inicial, la acción visible, la ruta de la cámara, el sonido y el estado final en ese orden. Para flujos de trabajo de imágenes o referencias, describa lo que controla cada entrada en lugar de repetir detalles que el modelo ya puede ver.
Guía rápida MiniMax H3: respuesta rápida
- Estructura del mensaje: fotograma inicial, acción, respuesta ambiental, cámara, audio y fotograma final.
- Texto a vídeo: define toda la escena porque ninguna imagen fuente lo establece.
- Imagen a vídeo: conserva los detalles fijos y describe solo lo que cambia después del primer fotograma.
- Referencia a vídeo: asigne un trabajo claro a cada archivo de imagen, vídeo o audio.
- Audio: diálogo separado, sonido físico, ambiente y música de fondo.
- Configuración de C Dance AI: de 4 a 15 segundos, con salida 768P y 2K.
Los ejemplos siguientes son plantillas de escritura en lugar de resultados de referencia controlados. La sección comunitaria identifica su material de prueba por separado.
¿Qué es MiniMax H3?
MiniMax H3, también conocido como Hailuo 3.0, es un modelo de video de IA que genera video y audio estéreo nativo a partir de texto y referencias visuales. Esta guía aplica la estructura de avisos oficial a MiniMax H3 en C Dance AI.
| Propiedad | Alcance del artículo actual |
|---|---|
| Principales flujos de trabajo | Texto a vídeo, imagen a vídeo, primer/último fotograma y referencia a vídeo |
| Longitud del mensaje en C Dance AI | 1 a 7.000 caracteres |
| Duración en C Dance AI | Números enteros de 4 a 15 segundos |
| Resolución en C Dance AI | 768P o 2K |
| audio nativo | Diálogo, ambientación, sonido físico y música de fondo. |
| Contrato de referencia | Hasta 9 imágenes, 3 vídeos, 3 archivos de audio y 12 archivos en total |
¿Qué modo MiniMax H3 debería utilizar?
| Modo | Lo que la entrada ya define | Lo que debe definir el mensaje | Error común |
|---|---|---|---|
| Texto a vídeo | Nada visual | Composición inicial, tema, acción, cámara, sonido y final. | Comenzando con el movimiento antes de establecer la escena. |
| Imagen a vídeo | Apariencia y composición del primer fotograma. | Detalles conservados y movimiento después del primer cuadro. | Reescribir la imagen en lugar de describir el cambio. |
| Primer/último fotograma | Estados de apertura y finalización | La transición física entre ambos fotogramas. | Describir dos imágenes fijas sin acción de conexión |
| Referencia a video | Señales de identidad, movimiento, estilo o sincronización asignadas | Un rol por activo y la transformación prevista | Agregar referencias que entran en conflicto entre sí |
¿Cómo debería estructurarse un mensaje MiniMax H3?
Un primer borrador útil responde seis preguntas en orden:
- ¿Qué hay en el cuadro de apertura?
- ¿Qué hace el sujeto?
- ¿Cómo reacciona el medio ambiente?
- ¿Hacia dónde se mueve la cámara?
- ¿Qué se puede escuchar?
- ¿Qué muestra el fotograma final?
Para un clip de producto de una sola toma, esto podría ser:
Vídeo de producto de estudio de acción en vivo. Una lata de bebida cítrica fría se encuentra erguida sobre una piedra oscura. Un estrecho chorro de agua golpea la superficie al lado de la lata y la salpicadura se enrosca alrededor de su base mientras la condensación desciende por el metal. La cámara traza un arco lento en el sentido de las agujas del reloj, manteniendo la etiqueta mirando hacia la lente. Luz de borde nítida, reflejos sobrios. El disparo finaliza con el agua sedimentada y la lata centrada.
El mensaje describe causa y efecto. El agua golpea la superficie, las salpicaduras se mueven alrededor de la lata y las gotas se depositan. La "física de líquidos realista" es menos útil porque nombra una cualidad deseada sin definir el evento.
Abra el espacio de trabajo C Dance AI con MiniMax H3 seleccionado cuando esté listo para probar un mensaje.
¿Cómo cambia el mensaje en el modo H3?
H3 admite varios flujos de trabajo y cada uno necesita información diferente. Repetir el mismo mensaje en todos los modos desperdicia el control proporcionado por los activos de entrada.
Texto a vídeo: define toda la toma
El texto a vídeo no tiene una imagen de apertura para establecer el tema o la composición. Describe el cuadro inicial antes de que comience la acción.
Imagen en vivo, plano medio ancho dentro de una tranquila panadería antes del amanecer. Un panadero abre las contraventanas de madera, coloca un pan caliente sobre la encimera y luego corta una rebanada mientras el vapor sube. La cámara empuja lentamente hacia el pan sin cambiar de altura. El ambiente de la calle permanece débil detrás del chirrido de las contraventanas y el crujiente corte a través de la corteza. Una suave guitarra acústica suena debajo del escenario. Termine con una vista cercana del pan rebanado.
Mantenga la apertura concreta: encuadre, posición del sujeto, entorno y luz. Una indicación que comienza con el movimiento pero que nunca establece la escena obliga al modelo a decidir demasiadas cosas a la vez.
Imagen a vídeo: describe qué cambios después del primer fotograma
La imagen cargada ya proporciona apariencia y composición. No dedique la mitad del mensaje a repetir cada detalle visible. Identifique qué debe permanecer fijo y luego describa el siguiente movimiento.
Utilice la imagen cargada como el marco de apertura exacto. Conserve el rostro de la mujer, la rebeca azul, el collar de plata, la posición del asiento y el diseño del vagón del tren. Levanta la mirada de la carta doblada hacia la ventana cubierta por la lluvia y luego dobla el papel por el pliegue existente. La cámara se mueve lentamente hacia la derecha mientras su reflejo cruza el cristal. La lluvia golpea la ventana por encima del ritmo bajo de las ruedas del tren. Sin música de fondo.
Si proporciona un primer y un último fotograma, describa la ruta física entre ellos. Evite escribir dos descripciones de imágenes estáticas. Explique cómo la pose, los objetos, la cámara y la luz se mueven desde el estado inicial hasta el estado final.
Referencia a vídeo: déle a cada activo un trabajo
El contrato de proveedor H3 conectado a C Dance AI admite hasta nueve imágenes, tres vídeos y tres archivos de audio, con un total de 12 archivos. El espacio de trabajo público actualmente expone texto a video e imagen a video; Los controles de referencia completa dependen de la interfaz disponible al generar. Más referencias no garantizan una mejor continuidad. Cada expediente debe resolver una incertidumbre específica.
Utilice roles de referencia como:
- La imagen 1 define el rostro y el cabello de la persona.
- La imagen 2 define el outfit y la paleta de colores.
- El vídeo 1 proporciona el movimiento del cuerpo y el ritmo de la cámara.
- Audio 1 proporciona la voz o la referencia de tiempo.
Luego escribe la transformación directamente:
Utilice a la persona de la Imagen 1 como único intérprete. Preserva sus proporciones faciales, cabello negro corto y chaqueta roja. Siga el movimiento del cuerpo y la sincronización de la toma del Video 1, pero coloque la acción en la plataforma del metro que se muestra en la Imagen 2. Mantenga la trayectoria de la cámara y la secuencia de pose del artista del Video 1. Utilice el Audio 1 para sincronizar; no agregue música de fondo.
Las referencias contradictorias son una fuente común de deriva. Si dos imágenes muestran diferentes atuendos o formas de rostro, H3 debe decidir qué detalles conservar. Elimine la referencia más débil antes de agregar más texto.
¿Qué muestran las pruebas comunitarias H3?
Las reglas oficiales de aviso explican la sintaxis. Las pruebas comunitarias muestran qué variables merecen una verificación temprana.
Un punto de referencia público reunió 1.000 generaciones H3 en muchos temas y estilos. Su cuadrícula de muestra cubre rostros, tipografía, multitudes, contacto físico, animación, movimiento de cámara y escenas cotidianas. Ese rango proporciona más evidencia que un solo clip atractivo, y al mismo tiempo requiere que se inspeccionen las salidas individuales para detectar fallas.

Una amplia variedad puede ocultar fracasos individuales. Para una evaluación enfocada, mantenga la entrada, la duración, el modo, la resolución y una variable modificada al lado de cada intento.
Una prueba comunitaria separada de referencia a video combinó referencias de personajes, entornos y objetos en una escena en movimiento. Dos imágenes definen a los artistas, una define el entorno montañoso y la otra define las bicicletas. Esos roles eliminan cuatro ambigüedades visuales de un mensaje genérico para "dos personajes de anime andando en bicicleta".
El usuario de Reddit irmemon225 creó esta muestra de flujo de trabajo de referencia. Documenta un resultado de un conjunto de referencia; no establece una tasa promedio de éxito.
Una segunda prueba comunitaria utilizó baja resolución y un bajo número de pasos para refinar las indicaciones antes del renderizado final. El borrador del pase verifica el número de sujetos, la dirección de la cámara, los roles de referencia y el orden de las tomas. Aumentar la calidad después de que esos elementos estén estables.
¿Cómo debería escribirse el movimiento de la cámara?
Elija una trayectoria de cámara dominante para una toma corta. H3 comprende movimientos como empujar hacia adentro, sacar, girar, mover, inclinar, pedestal, arco, seguimiento, encuadre estático, sacudir, punto de vista, hacer zoom y rodar.
Escribe el movimiento dentro de la escena:
La cámara sigue al ciclista al nivel de la calle manteniendo la misma distancia.
Evite una pila de etiquetas como:
cámara dinámica, disparo de drone, órbita, movimiento horizontal, zoom, enfoque en rack
Esas instrucciones compiten por los mismos segundos. Si la toma necesita una revelación, indique la vista inicial, el movimiento y lo que revela la cámara:
Un primer plano comienza sobre la harina que cubre las manos del panadero. La cámara retrocede lentamente, revelando la mesa de trabajo completa y seis panes terminados mientras el panadero continúa amasando.
Utilice un corte sólo cuando la siguiente toma aporte nueva información. Un ligero cambio en la distancia suele manejarse mejor con el movimiento de la cámara.
¿Cómo se escribe un mensaje H3 de múltiples disparos?
Un clip de 6 segundos no puede transmitir la misma historia que un clip de 15 segundos. Asigne tiempo a cada tiempo antes de agregar detalles.
Este anuncio de producto de 10 segundos utiliza tres tomas:
[Toma 1] Comercial de imagen real, vista cercana de un corredor atándose un zapato en una pista mojada antes del amanecer. La cámara permanece baja y estática. La tela tira fuerte y el encaje se rompe suavemente.
[Toma 2] A las 00:03.000, corte a un plano de seguimiento lateral mientras el corredor acelera en la primera curva. Cada pisada arroja un pequeño chorro de agua desde la pista. La respiración y los impactos de los pies se elevan por encima del ambiente lejano de la ciudad.
[Tiro 3] En 00:07.000, corte hasta el aterrizaje del zapato al lado de la línea de meta, luego empuje lentamente cuando el corredor se detenga. Un breve pulso de bajo termina con el paso final.
Los tiempos de corte dejan tres segundos para la preparación, cuatro para la acción principal y tres para la meta. Si se suma el diálogo, éste debe encajar dentro del mismo presupuesto.
No agregues marcas de tiempo a cada movimiento en una sola toma continua. Úsalos para marcar distintos cortes o eventos cronometrados esenciales.
¿Cómo se activan el diálogo y el audio nativo?
H3 genera vídeo y sonido estéreo nativo juntos. Un mensaje se vuelve más fácil de controlar cuando distingue tres capas de audio:
- Diálogo: palabras exactas pronunciadas por una persona identificada.
- Paisaje sonoro: ambiente, pasos, impactos, tela, lluvia, respiración o maquinaria.
- Música de fondo: música que escucha el público pero no las personas en la escena.
Para dos hablantes, mantenga estables sus identidades:
[Plano 1] Imagen real, plano medio en un pequeño compartimiento de tren. La mujer junto a la ventana, hablando en voz baja (Hablante 1), dice en inglés: "Me bajo en la siguiente estación". El revisor en la puerta, en voz baja (Hablante 2), responde en inglés: "Llegamos en dos minutos". Sus bocas se mueven sólo durante sus propias líneas.
Paisaje sonoro: ruido constante de ruedas, lluvia ligera contra el cristal y un suave golpe de billete.
Música de fondo: notas de piano escasas a un ritmo lento, que se desvanecen antes de que el director responda.
Mantenga la copia hablada breve. Léelo en voz alta con un cronómetro. Si una frase tarda cinco segundos en decirse, no puede encajar de forma natural junto a otra línea y varias acciones en un vídeo de 6 segundos.
Para la voz en off, digamos que está fuera de la pantalla y que los labios del sujeto en pantalla permanecen cerrados. Esto reduce la posibilidad de que H3 asigne la narración al personaje visible.
¿Qué ejemplos de indicaciones de MiniMax H3 puedes adaptar?
Estas indicaciones cubren diferentes problemas de producción. Reemplace el tema y los detalles de la marca, pero conserve la lógica de acción.
Una demostración de creador vertical
Video telefónico vertical de acción en vivo en un apartamento luminoso. Una mujer mira hacia la lente mientras sostiene una aspiradora de mano compacta en su mano derecha. Señala la boquilla con el dedo índice izquierdo, se inclina hacia el sofá y retira una hilera de migas de una sola pasada. La cámara tiene un ligero movimiento manual pero mantiene las manos y el producto encuadrado. Luz natural de la ventana. El motor arranca cuando la boquilla llega al sofá y se detiene al final. Sin cortes y sin música de fondo.
Una animación de moda en el primer fotograma.
Utilice el retrato subido exactamente como el primer fotograma. Preserva el rostro de la modelo, el cabello trenzado, el abrigo verde y la posición de la calle detrás de ella. Gira los hombros hacia la carretera, da dos pasos medidos y mira hacia atrás por encima del hombro izquierdo. La cámara retrocede al caminar y mantiene una composición de cuerpo completo. El viento mueve el dobladillo del abrigo en la misma dirección que su turno. Termina con su rostro visible en perfil de tres cuartos.
Una escena de acción física.
Filmación de cuerpo entero en acción real en un almacén vacío. Un especialista corre hacia una barrera baja de madera, planta ambos pies, la supera, aterriza con las rodillas dobladas, rueda sobre el hombro derecho y se pone a correr. El polvo se levanta con el impacto y se deposita detrás de él. Una cámara en mano estabilizada lo sigue desde tres metros atrás sin adelantarlo. Luz lateral intensa a través de ventanas altas. Un plano continuo con pasos, movimiento de la ropa, el impacto del aterrizaje y sin música.
Un reemplazo de personaje basado en referencias
Utilice el Vídeo 1 como fuente para la sincronización de las tomas, los ángulos de la cámara, el movimiento del cuerpo y la acción de fondo. Reemplace solo al intérprete en el Video 1 con la persona definida en la Imagen 1. Conserve las proporciones de la cara, el cabello, la ropa y el cuerpo de la Imagen 1 en todo el clip. Mantenga sin cambios todas las demás personas, objetos, movimientos de la cámara y sonidos ambientales del Video 1. No copie el fondo de la Imagen 1.
El ejemplo final necesita el modo de referencia. Un mensaje normal de imagen a vídeo no tiene que conservar la sincronización ni el movimiento del vídeo de origen.
¿Por qué MiniMax H3 ignora las instrucciones rápidas?
Cuando falla una salida, cambie la instrucción más pequeña que explique la falla.
| Falla | Probable problema rápido | Primera revisión |
|---|---|---|
| cortes aleatorios | Varios movimientos de cámara o cambios de escena compiten | Solicite una toma continua y una trayectoria de cámara |
| Habla la persona equivocada | Los hablantes no se identifican consistentemente | Asigne a cada hablante una etiqueta estable y acorte el intercambio. |
| El diálogo se vuelve apresurado | La fila es demasiado larga para la duración. | Cronometre la línea en voz alta o aumente la duración del clip |
| El producto cambia de forma. | La acción, la cámara y el estilo sobrecargan la toma. | Bloquee la orientación del producto y elimine el movimiento secundario. |
| Desviaciones de identidad de referencia | Las referencias entran en conflicto o tienen roles poco claros. | Mantenga la imagen de identidad más clara y establezca cada rol restante. |
| El primer y el último fotograma no se conectan | Falta la transición física | Describir los cambios intermedios de pose, objeto y cámara. |
| El sonido no parece tener relación | El audio se expresa solo como un estado de ánimo. | Nombra la fuente, el tiempo y el cambio de volumen. |
No reescriba todo el mensaje después de cada error. Si la cámara se equivocó pero el sujeto se mantuvo constante, mantenga el lenguaje del sujeto y revise la oración de la cámara. Esto hace que cada reintento sea informativo.
¿Qué duración y resolución deberías elegir?
La integración actual C Dance AI acepta duraciones de números enteros de 4 a 15 segundos. Ofrece salida 768P y 2K, y el valor predeterminado es una generación 2K de 6 segundos.
Cálculo del crédito base actual:
| Configuración | Créditos |
|---|---|
| 768P | 50 por segundo de salida |
| 2K | 80 por segundo de salida |
| Cada imagen de referencia después de las primeras cinco | 25 créditos adicionales |
Por lo tanto, una generación de texto a vídeo de 6 segundos comienza con 300 créditos en 768P o 480 créditos en 2K. Según el contrato de referencia, la duración del vídeo de referencia y las imágenes de referencia adicionales pueden aumentar el total. El espacio de trabajo muestra el cálculo antes del envío.
Redactar con la menor duración que pueda contener la acción y el diálogo. Utilice 768P para las primeras pruebas de composición cuando los detalles finales aún no son la cuestión. Pase a 2K después de que la sincronización del mensaje y el comportamiento de la cámara sean estables.
¿Qué debes comprobar antes de generar?
Lea el mensaje una vez y confirme:
- El cuadro de apertura es claro.
- El clip tiene una acción principal.
- Se describen tanto la causa como el efecto visible.
- Las instrucciones de la cámara no entran en conflicto.
- Los cortes se ajustan dentro de la duración seleccionada.
- Cada hablante y referente guarda una identidad.
- El diálogo se puede hablar a tiempo.
- El ambiente y la música tienen trabajos separados.
- El estado final es visible y alcanzable.
Después, vuelve a la página principal de C Dance AI o abre el Workspace con MiniMax H3 ya seleccionado. Guarda el prompt y los ajustes de cada intento, registra claramente el fallo y cambia una sola variable antes de volver a probar.
Preguntas frecuentes sobre el mensaje MiniMax H3
¿Qué debe incluir un mensaje MiniMax H3?
Comience con el sujeto y la acción visible, luego defina la configuración, la trayectoria de la cámara, el orden de las tomas, el diálogo, el sonido físico y la música de fondo que necesita el clip. Mantenga cada instrucción compatible con la duración seleccionada.
¿Cuánto tiempo puede durar un vídeo MiniMax H3 en C Dance AI?
La integración actual C Dance AI acepta duraciones de números enteros de 4 a 15 segundos y ofrece salida 768P y 2K.
¿MiniMax H3 genera audio?
Sí. MiniMax H3 puede generar audio estéreo nativo con el vídeo. Las indicaciones pueden dirigir el diálogo, el ambiente, los efectos de sonido físico y la música de fondo.
¿Puede MiniMax H3 utilizar referencias de imagen, vídeo y audio?
El contrato de proveedor H3 admite referencias de imagen, vídeo y audio. C Dance AI actualmente expone texto a video e imagen a video en el espacio de trabajo público; Los controles de referencia completa dependen de la interfaz disponible al generar.
¿Cómo debo iniciar el diálogo en MiniMax H3?
Identifique a cada hablante de manera consistente, escriba la línea hablada exacta, especifique el idioma y deje suficiente tiempo para la línea. Separe el diálogo del ambiente y la música de fondo para que sus roles queden claros.
¿Por qué MiniMax H3 ignora partes de un mensaje?
El mensaje puede contener demasiadas acciones, movimientos de cámara contradictorios, roles de referencia poco claros o más diálogo del que cabe en el clip. Elimine las instrucciones secundarias y pruebe un cambio a la vez.

