MiniMax H3 프롬프트는 타임라인으로 가장 잘 작동합니다. 오프닝 프레임, 보이는 동작, 카메라 경로, 사운드, 종료 상태를 순서대로 정의합니다. 이미지 또는 참조 워크플로의 경우 모델이 이미 볼 수 있는 세부 정보를 반복하는 대신 각 입력이 무엇을 제어하는지 설명하세요.
MiniMax H3 프롬프트 가이드: 빠른 답변
- 프롬프트 구조: 오프닝 프레임, 액션, 환경 반응, 카메라, 오디오, 최종 프레임.
- 텍스트-비디오: 소스 이미지가 없기 때문에 전체 장면을 정의합니다.
- 이미지-비디오: 고정된 세부 사항을 보존하고 프레임 1 이후에 변경된 사항만 설명합니다.
- 비디오 참조: 각 이미지, 비디오 또는 오디오 파일에 하나의 명확한 작업을 할당합니다.
- 오디오: 별도의 대화, 실제 사운드, 분위기 및 배경 음악.
- C Dance AI 설정: 768P 및 2K 출력에서 4~15초.
아래 예는 제어된 벤치마크 결과가 아닌 템플릿을 작성하는 것입니다. 커뮤니티 섹션에서는 테스트 자료를 별도로 식별합니다.
MiniMax H3란 무엇입니까?
Hailuo 3.0라고도 알려진 MiniMax H3는 텍스트 및 시각적 참조에서 비디오 및 기본 스테레오 오디오를 생성하는 AI 비디오 모델입니다. 이 가이드에서는 MiniMax H3 in C Dance AI에 공식 프롬프트 구조를 적용합니다.
| 재산 | 현재 기사 범위 |
|---|---|
| 주요 작업흐름 | 텍스트-비디오, 이미지-비디오, 첫 번째/마지막 프레임 및 비디오 참조 |
| C Dance AI의 프롬프트 길이 | 1~7,000자 |
| C Dance AI의 기간 | 4초에서 15초 사이의 정수 |
| C Dance AI의 해상도 | 768P 또는 2K |
| 네이티브 오디오 | 대화, 분위기, 물리적 사운드 및 배경 음악 |
| 참조 계약 | 이미지 최대 9개, 비디오 3개, 오디오 파일 3개, 총 12개 파일 |
어떤 MiniMax H3 모드를 사용해야 합니까?
| 방법 | 입력이 이미 정의한 것 | 프롬프트가 정의해야 하는 것 | 흔한 실수 |
|---|---|---|---|
| 텍스트-비디오 | 시각적이지 않음 | 오프닝 구성, 주제, 액션, 카메라, 사운드, 엔딩 | 장면을 설정하기 전에 모션으로 시작하기 |
| 이미지-비디오 | 모양 및 첫 번째 프레임 구성 | 프레임 1 이후의 디테일과 움직임이 보존됨 | 변경 사항을 설명하는 대신 이미지를 다시 작성합니다. |
| 첫 번째/마지막 프레임 | 시작 및 종료 상태 | 두 프레임 간의 물리적 전환 | 연결 동작이 없는 두 개의 정지 이미지 설명 |
| 비디오 참조 | 할당된 ID, 동작, 스타일 또는 타이밍 신호 | 자산당 하나의 역할 및 의도된 변환 | 서로 충돌하는 참조 추가 |
MiniMax H3 프롬프트는 어떻게 구성되어야 합니까?
유용한 첫 번째 초안은 다음과 같은 6가지 질문에 답합니다.
- 오프닝 프레임에는 무엇이 들어있나요?
- 주제는 무엇을 하는가?
- 환경은 어떻게 반응하나요?
- 카메라는 어디로 이동하나요?
- 무엇을 들을 수 있나요?
- 마지막 프레임은 무엇을 보여줍니까?
단일 제품 클립의 경우 다음과 같을 수 있습니다.
실사 스튜디오 제품 영상입니다. 차가운 감귤 음료는 어두운 돌 위에 똑바로 서 있을 수 있습니다. 좁은 물줄기가 캔 옆 표면에 부딪히면 물보라가 캔 바닥 주위로 말리면서 응축수가 금속 아래로 이동합니다. 카메라는 라벨이 렌즈를 향하도록 유지하면서 시계 방향으로 천천히 원호를 만듭니다. 선명한 림 조명, 억제된 반사. 샷은 물이 안정되고 캔이 중앙에 위치하면서 끝납니다.
프롬프트는 원인과 결과를 설명합니다. 물이 표면에 닿으면 물보라가 캔 주위로 움직이고 물방울이 침전됩니다. "현실적인 액체 물리학"은 이벤트를 정의하지 않고 원하는 품질을 지정하기 때문에 덜 유용합니다.
프롬프트를 테스트할 준비가 되면 MiniMax H3가 선택된 C Dance AI 작업 공간을 엽니다.
H3 모드에 따라 프롬프트가 어떻게 바뀌나요?
H3는 여러 워크플로를 지원하며 각 워크플로에는 서로 다른 정보가 필요합니다. 모든 모드에서 동일한 프롬프트를 반복하면 입력 자산이 제공하는 제어가 낭비됩니다.
텍스트-비디오: 전체 장면 정의
텍스트-비디오에는 주제나 구성을 설정하는 시작 이미지가 없습니다. 작업이 시작되기 전의 초기 프레임을 설명합니다.
해가 뜨기 전 조용한 빵집 내부에서 실사로 촬영한 미디엄 와이드 샷입니다. 빵 굽는 사람이 나무 덧문을 열고 따뜻한 빵을 카운터 위에 올려놓은 후 김이 올라오면서 한 조각을 자릅니다. 카메라는 높이를 바꾸지 않고 천천히 빵을 향해 밀어냅니다. 셔터의 긁힌 자국과 바삭바삭한 표면 뒤에는 거리의 분위기가 희미하게 남아 있습니다. 부드러운 어쿠스틱 기타가 장면 아래에서 연주됩니다. 얇게 썬 빵을 가까이서 보면서 끝냅니다.
프레임, 피사체 위치, 설정, 조명 등 입구를 구체적으로 유지하세요. 움직임으로 시작하지만 장면을 설정하지 않는 프롬프트는 모델이 한 번에 너무 많은 것을 결정하게 만듭니다.
이미지-비디오: 프레임 1 이후에 어떤 변화가 있는지 설명
업로드된 이미지는 이미 모양과 구성을 제공합니다. 보이는 모든 세부 사항을 반복하는 데 프롬프트의 절반을 소비하지 마십시오. 고정되어야 할 사항을 식별한 후 다음 동작을 설명합니다.
업로드된 이미지를 정확한 오프닝 프레임으로 사용하세요. 여성의 얼굴, 파란색 카디건, 은목걸이, 좌석 위치, 열차 객차 배치를 그대로 유지합니다. 그녀는 접힌 편지에서 눈을 들어 비에 젖은 창문을 바라보고, 접힌 부분을 따라 종이를 접습니다. 그녀의 반사가 유리를 가로지르는 동안 카메라는 오른쪽으로 천천히 움직입니다. 기차 바퀴의 낮은 리듬 위에 빗물이 창문을 두드린다. 배경음악이 없습니다.
첫 번째 프레임과 마지막 프레임을 모두 제공하는 경우 두 프레임 사이의 물리적 경로를 설명하세요. 두 개의 정적 이미지 설명을 작성하지 마세요. 포즈, 물체, 카메라, 조명이 어떻게 열림 상태에서 끝 상태로 이동하는지 설명합니다.
비디오 참조: 모든 자산에 하나의 작업 제공
C Dance AI에 연결된 H3 공급자 계약은 최대 9개의 이미지, 3개의 비디오, 3개의 오디오 파일(총 12개 파일)을 지원합니다. 공개 작업 공간은 현재 텍스트를 비디오로, 이미지를 비디오로 노출합니다. 전체 참조 컨트롤은 생성 시 사용 가능한 인터페이스에 따라 달라집니다. 더 많은 참조가 더 나은 연속성을 보장하지는 않습니다. 각 파일은 특정 불확실성을 해결해야 합니다.
다음과 같은 참조 역할을 사용하십시오.
- 이미지 1은 사람의 얼굴과 머리카락을 정의합니다.
- 이미지 2는 의상과 색상 팔레트를 정의합니다.
- 비디오 1은 신체 움직임과 카메라 리듬을 제공합니다.
- 오디오 1은 음성 또는 타이밍 참조를 제공합니다.
그런 다음 변환을 직접 작성합니다.
이미지 1의 사람을 유일한 수행자로 사용하십시오. 얼굴 비율, 짧은 검은 머리, 빨간 재킷을 유지하세요. 비디오 1의 신체 움직임과 샷 타이밍을 따르되 이미지 2에 표시된 지하철 플랫폼에 동작을 배치합니다. 비디오 1의 카메라 경로와 연기자 포즈 시퀀스를 유지합니다. 타이밍에는 오디오 1을 사용합니다. 배경음악을 추가하지 마세요.
충돌하는 참조는 드리프트의 일반적인 원인입니다. 두 이미지에서 서로 다른 복장이나 얼굴 모양이 나타나는 경우 H3는 어떤 세부 사항을 유지할지 결정해야 합니다. 프롬프트 텍스트를 더 추가하기 전에 약한 참조를 제거하십시오.
커뮤니티 H3 테스트는 무엇을 보여줍니까?
공식 프롬프트 규칙은 구문을 설명합니다. 커뮤니티 테스트는 어떤 변수가 조기 점검이 필요한지 보여줍니다.
한 공개 벤치마크에서는 다양한 주제와 스타일에 걸쳐 1,000개의 H3 세대를 수집했습니다. 샘플 그리드는 얼굴, 타이포그래피, 군중, 신체 접촉, 애니메이션, 카메라 움직임 및 일반적인 장면을 다룹니다. 이 범위는 하나의 매력적인 클립보다 더 많은 증거를 제공하는 동시에 개별 출력의 오류를 검사해야 합니다.

다양성은 개인의 실패를 숨길 수 있습니다. 집중적인 평가를 위해 각 시도 옆에 입력, 기간, 모드, 해상도 및 변경된 변수 하나를 유지합니다.
비디오에 대한 별도의 커뮤니티 참조 테스트는 하나의 움직이는 장면에서 캐릭터, 환경 및 개체 참조를 결합했습니다. 두 이미지는 공연자를 정의하고, 하나는 산 환경을 정의하고, 다른 하나는 자전거를 정의합니다. 이러한 역할은 "자전거를 타는 애니메이션 캐릭터 2명"에 대한 일반적인 프롬프트에서 네 가지 시각적 모호성을 제거합니다.
Reddit 사용자 irmemon225가 이 참조 워크플로 샘플을 만들었습니다. 하나의 참조 세트에서 하나의 출력을 문서화합니다. 평균 성공률을 설정하지 않습니다.
두 번째 커뮤니티 테스트에서는 최종 렌더링 전에 프롬프트를 다듬기 위해 낮은 해상도와 낮은 단계 수를 사용했습니다. 드래프트 패스는 피사체 수, 카메라 방향, 참조 역할 및 촬영 순서를 확인합니다. 해당 요소가 안정된 후에 품질을 높이십시오.
카메라 모션은 어떻게 작성해야 하나요?
짧은 촬영을 위해 하나의 주요 카메라 경로를 선택합니다. H3는 푸시 인, 풀 아웃, 팬, 트럭, 틸트, 받침대, 호, 추적, 정적 프레이밍, 흔들기, 시점, 확대/축소 및 롤과 같은 동작을 이해합니다.
장면 내부의 움직임을 작성합니다.
카메라는 동일한 거리를 유지하면서 거리 수준에서 자전거 타는 사람 옆을 추적합니다.
다음과 같은 라벨이 쌓이지 않도록 하세요.
다이내믹 카메라, 드론 샷, 궤도, 휩 팬, 줌, 랙 초점
이러한 명령어는 동일한 시간 동안 경쟁합니다. 장면에 공개가 필요한 경우 시작 뷰, 움직임, 카메라가 공개하는 내용을 명시하세요.
빵 굽는 사람의 손을 덮은 밀가루 위에서 클로즈업 샷이 시작됩니다. 빵 굽는 사람이 계속 반죽하는 동안 카메라가 천천히 뒤로 물러나 전체 작업대와 완성된 빵 6개를 보여줍니다.
다음 장면이 새로운 정보를 제공할 때만 컷을 사용하세요. 거리의 약간의 변화는 일반적으로 카메라 움직임에 의해 더 잘 처리됩니다.
멀티샷 H3 프롬프트를 어떻게 작성하나요?
6초짜리 클립은 15초짜리 클립과 같은 스토리를 전달할 수 없습니다. 세부 사항을 추가하기 전에 각 비트에 시간을 할당하십시오.
이 10초 제품 광고는 3개의 장면을 사용합니다.
[샷 1] 실사 광고, 새벽이 되기 전 젖은 트랙에서 신발 한 짝을 묶는 주자의 모습. 카메라는 낮고 정적인 상태를 유지합니다. 패브릭이 팽팽하게 당겨지고 레이스가 부드럽게 끊어집니다.
[샷 2] 00:03.000에 주자가 첫 번째 굴곡을 통과하면서 가속하면서 측면 추적 샷으로 전환합니다. 각 발소리는 트랙에서 작은 물보라를 뿜어냅니다. 숨소리와 발의 충격이 먼 도시의 분위기를 뛰어넘습니다.
[샷 3] 00:07.000에 결승선 옆의 착지 지점으로 컷을 한 다음 주자가 멈추자 천천히 밀어 넣습니다. 짧은 베이스 펄스가 마지막 발자국으로 끝납니다.
컷 시간은 설정에 3초, 메인 액션에 4초, 마무리에 3초가 소요됩니다. 대사를 추가한다면 같은 예산에 맞아야 합니다.
단일 연속 샷의 모든 움직임에 타임스탬프를 추가하지 마세요. 이를 사용하여 뚜렷한 컷이나 필수 시간 제한 이벤트를 표시합니다.
대화와 네이티브 오디오를 어떻게 프롬프트합니까?
H3는 비디오와 기본 스테레오 사운드를 함께 생성합니다. 세 가지 오디오 레이어를 구별하면 프롬프트를 더 쉽게 제어할 수 있습니다.
- 대화: 식별된 사람이 말한 정확한 단어입니다.
- 소리의 풍경: 분위기, 발자국, 충격, 직물, 비, 호흡 또는 기계.
- 배경 음악: 청중에게는 들리지만 장면에 있는 사람들에게는 들리지 않는 음악입니다.
화자가 두 명인 경우 신원을 안정적으로 유지하세요.
[샷 1] 작은 기차 칸에서 실사로 촬영한 미디엄 샷. 창가에 있는 여성이 부드럽게 말하면서(화자 1) 영어로 말합니다. "다음 역에서 내립니다." 문 앞에 있는 차장은 낮은 목소리(화자 2)로 영어로 "2분 후에 도착합니다."라고 대답합니다. 입은 자신의 대사 중에만 움직입니다.
사운드스케이프: 꾸준한 휠 소음, 유리에 부딪히는 가벼운 비, 부드러운 티켓 펀치 한 번.
배경 음악: 느린 템포의 드문드문 피아노 음이 지휘자가 응답하기 전에 사라집니다.
음성 문구를 짧게 유지하세요. 타이머를 이용해 소리내어 읽어보세요. 문장을 말하는 데 5초가 걸리면 6초짜리 동영상에서 다른 줄과 여러 동작 옆에 자연스럽게 들어갈 수 없습니다.
음성 해설의 경우 화면 밖에 있고 화면 속 피사체의 입술이 닫혀 있다고 말합니다. 이렇게 하면 H3가 보이는 캐릭터에 내레이션을 할당할 가능성이 줄어듭니다.
어떤 MiniMax H3 프롬프트 예시를 적용할 수 있나요?
이러한 프롬프트는 다양한 생산 문제를 다룹니다. 주제와 브랜드 세부정보를 바꾸되 작업 논리는 유지하세요.
수직 크리에이터 시연
밝은 아파트의 수직 실사 전화 영상입니다. 한 여성이 오른손에 소형 휴대용 진공청소기를 들고 렌즈를 바라보고 있습니다. 그녀는 왼손 집게손가락으로 노즐을 가리키며 소파 쪽으로 몸을 굽혀 부스러기 한 줄을 한 번에 제거합니다. 카메라는 손에 들고 가볍게 움직이지만 손과 제품이 프레임에 고정됩니다. 자연적인 창문 조명. 노즐이 소파에 닿으면 모터가 작동하다가 끝에서 멈춥니다. 컷도 없고 배경음악도 없습니다.
첫 번째 프레임 패션 애니메이션
업로드된 인물 사진을 정확한 첫 번째 프레임으로 사용하세요. 모델의 얼굴, 땋은 머리, 녹색 코트, 모델 뒤의 거리 위치를 유지하세요. 그녀는 길을 향해 어깨를 돌리고, 두 걸음을 측정한 다음, 왼쪽 어깨 너머로 뒤를 돌아봅니다. 카메라는 걷는 속도로 뒤로 추적하고 전신 구도를 유지합니다. 바람은 코트 밑단을 자신의 차례와 같은 방향으로 움직입니다. 3/4 프로필에 그녀의 얼굴이 보이는 것으로 끝납니다.
신체적인 액션 장면
빈 창고에서 실사 전신샷. 스턴트 연기자는 낮은 나무 장벽을 향해 달려가 두 발을 딛고 이를 치운 다음 무릎을 구부린 채 착지하고 오른쪽 어깨 위로 굴러 올라가 달려갑니다. 충격을 받으면 먼지가 떠올라 그의 뒤에 쌓입니다. 안정된 휴대용 카메라가 3미터 뒤에서 그를 따라잡지 않고 따라갑니다. 높은 창문을 통해 들어오는 측면 조명. 발자국, 옷의 움직임, 착지 충격이 포함된 연속 샷이며 음악은 없습니다.
참조 주도 문자 대체
비디오 1을 촬영 타이밍, 카메라 각도, 신체 움직임, 배경 동작의 소스로 사용하세요. 비디오 1의 연기자만 이미지 1에 정의된 사람으로 대체합니다. 클립 전체에서 이미지 1의 얼굴, 머리카락, 의복 및 신체 비율을 유지합니다. 비디오 1의 다른 모든 사람, 물체, 카메라 움직임 및 환경 소리를 변경하지 않고 유지하세요. 이미지 1의 배경을 복사하지 마세요.
마지막 예에는 참조 모드가 필요합니다. 일반적인 이미지-비디오 프롬프트에는 보존할 소스 비디오의 타이밍과 모션이 없습니다.
MiniMax H3가 프롬프트 지침을 무시하는 이유는 무엇입니까?
출력이 실패하면 실패를 설명하는 가장 작은 명령을 변경하십시오.
| 실패 | 즉각적인 문제가 발생할 가능성이 있음 | 첫 번째 개정 |
|---|---|---|
| 무작위 컷 | 여러 카메라 이동이나 장면 변경이 경쟁합니다. | 연속 촬영 1개와 카메라 경로 1개 요청 |
| 사람이 말을 잘못했네 | 화자가 지속적으로 식별되지 않음 | 각 스피커에 안정적인 라벨을 할당하고 교환 시간을 단축하세요. |
| 대화가 급해진다 | 대기시간에 비해 줄이 너무 길어요 | 큰 소리로 라인 시간을 맞추거나 클립 길이를 늘립니다. |
| 제품의 모양이 변경됨 | 액션, 카메라, 스타일이 장면에 과부하를 걸다 | 제품 방향을 잠그고 보조 동작을 제거합니다. |
| 참조 신원 드리프트 | 참조가 충돌하거나 역할이 불분명합니다. | 가장 명확한 아이덴티티 이미지를 유지하고 남은 각 역할을 명시합니다. |
| 첫 번째 프레임과 마지막 프레임이 연결되지 않음 | 물리적 전환이 누락되었습니다. | 중간 포즈, 개체 및 카메라 변경 사항을 설명합니다. |
| 소리가 관련성이 없는 느낌 | 오디오는 기분으로만 표현됩니다. | 소스 이름, 타이밍, 볼륨 변화 등을 지정하세요. |
실패할 때마다 전체 프롬프트를 다시 작성하지 마십시오. 카메라가 잘못됐지만 피사체가 일관성을 유지했다면 피사체 언어를 유지하고 카메라 문장을 수정하세요. 이는 각 재시도를 유익하게 만듭니다.
어떤 기간과 해상도를 선택해야 합니까?
현재 C Dance AI 통합은 4~15초의 정수 지속 시간을 허용합니다. 768P 및 2K 출력을 제공하며 기본값은 6초 2K 생성입니다.
현재 기본 학점 계산:
| 환경 | 크레딧 |
|---|---|
| 768P | 출력 초당 50 |
| 2K | 출력 초당 80 |
| 처음 5개 이후의 각 참조 이미지 | 25학점 추가 |
따라서 6초 텍스트-비디오 생성은 768P에서는 300크레딧, 2K에서는 480크레딧에서 시작됩니다. 참조 계약에 따라 참조 비디오 기간과 추가 참조 이미지로 인해 총계가 늘어날 수 있습니다. 작업 공간에는 제출 전 계산이 표시됩니다.
액션과 대사를 담을 수 있는 최단 시간의 초안입니다. 최종 세부 사항이 아직 결정되지 않은 경우 초기 구성 테스트에 768P를 사용하십시오. 프롬프트의 타이밍과 카메라 동작이 안정된 후 2K로 이동합니다.
생성하기 전에 무엇을 확인해야 합니까?
프롬프트를 한 번 읽고 확인하십시오.
- 오프닝 프레임이 명확합니다.
- 클립에는 하나의 주요 작업이 있습니다.
- 원인과 눈에 보이는 결과가 모두 설명되어 있습니다.
- 카메라 지침이 충돌하지 않습니다.
- 컷은 선택한 기간 내에 맞습니다.
- 각 화자와 참고인은 하나의 정체성을 유지합니다.
- 시간에 맞춰 대화를 할 수 있습니다.
- 분위기와 음악은 별개의 일을 합니다.
- 종료 상태가 표시되고 달성 가능합니다.
그런 다음 C Dance AI 홈으로 돌아가거나 MiniMax H3가 선택된 Workspace에서 생성하세요. 시도할 때마다 프롬프트와 설정을 저장하고, 실패 원인을 명확히 기록한 뒤 다시 시도하기 전에 변수 하나만 조정하세요.
MiniMax H3 프롬프트 FAQ
MiniMax H3 프롬프트에는 무엇이 포함되어야 합니까?
피사체와 눈에 보이는 동작부터 시작한 다음 클립에 필요한 설정, 카메라 경로, 샷 순서, 대화, 물리적 사운드 및 배경 음악을 정의합니다. 선택한 기간과 호환되는 각 지침을 유지하세요.
MiniMax H3 비디오는 C Dance AI에 얼마나 오래 보관될 수 있나요?
현재 C Dance AI 통합은 4~15초의 정수 지속 시간을 허용하고 768P 및 2K 출력을 제공합니다.
MiniMax H3는 오디오를 생성합니까?
예. MiniMax H3는 비디오와 함께 기본 스테레오 오디오를 생성할 수 있습니다. 프롬프트는 대화, 분위기, 물리적 음향 효과 및 배경 음악을 지시할 수 있습니다.
MiniMax H3는 이미지, 비디오 및 오디오 참조를 사용할 수 있습니까?
H3 공급자 계약은 이미지, 비디오 및 오디오 참조를 지원합니다. C Dance AI는 현재 공개 작업 공간에서 텍스트를 비디오로, 이미지를 비디오로 노출합니다. 전체 참조 컨트롤은 생성 시 사용 가능한 인터페이스에 따라 달라집니다.
MiniMax H3에서 대화를 어떻게 유도해야 합니까?
각 화자를 일관되게 식별하고, 정확한 대사를 작성하고, 언어를 지정하고, 대사에 충분한 시간을 두십시오. 대화를 분위기와 배경 음악과 분리하여 역할이 명확하게 유지되도록 하세요.
MiniMax H3가 프롬프트의 일부를 무시하는 이유는 무엇입니까?
프롬프트에는 너무 많은 작업, 충돌하는 카메라 움직임, 불분명한 참조 역할 또는 클립에 들어갈 수 있는 것보다 더 많은 대화가 포함될 수 있습니다. 보조 지침을 제거하고 한 번에 하나의 변경 사항을 테스트하십시오.

