MiniMax H3 提示词按时间线编写时效果最好。依次定义开场帧、可见动作、摄像机路径、声音和结束状态。使用图像或参考素材时,应说明每项输入负责控制什么,而不是重复模型已经看见的细节。
MiniMax H3 提示词指南:快速解答
- 提示结构:开场帧、动作、环境响应、摄像机、音频和最终帧。
- 文生视频:定义整个场景,因为没有源图像建立它。
- 图生视频:保留固定细节并仅描述第一帧之后发生的变化。
- 参考生视频:为每个图像、视频或音频文件分配一个明确用途。
- 音频:单独的对话、物理声音、氛围和背景音乐。
- C Dance AI 设置:4 至 15 秒,768P 和 2K 输出。
下面的示例是编写模板而不是受控基准测试结果。社区部分单独标识其测试材料。
MiniMax H3 是什么?
MiniMax H3,也称为 Hailuo 3.0,是一种 AI 视频模型,可根据文本和视觉参考生成视频和原生立体声音频。本指南将官方提示结构应用于C Dance AI中的MiniMax H3。
| 核心属性 | 本文覆盖范围 |
|---|---|
| 主要工作流程 | 文生视频、图生视频、第一帧/最后一帧和参考生视频 |
| C Dance AI 中的提示长度 | 1 到 7,000 个字符 |
| C Dance AI 的持续时间 | 4 到 15 秒的整数 |
| C Dance AI 分辨率 | 768P 或 2K |
| 原生音频 | 对话、氛围、物理声音和背景音乐 |
| 参考素材限制 | 总共最多 9 个图像、3 个视频、3 个音频文件和 12 个文件 |
您应该使用哪种 MiniMax H3 模式?
| 模式 | 输入已经定义了什么 | 提示必须定义什么 | 常见错误 |
|---|---|---|---|
| 文生视频 | 没有预设画面 | 开场构图、主体、动作、摄像机、声音和结尾 | 在建立场景之前从动作开始 |
| 图生视频 | 外观及第一帧构图 | 第一帧后保留的细节和运动 | 重写图像而不是描述变化 |
| 第一帧/最后一帧 | 开始和结束状态 | 两个帧之间的物理转换 | 描述两个没有连接动作的静止图像 |
| 参考生视频 | 指定的身份、动作、风格或时间线索 | 每项素材的用途和目标变换 | 添加相互冲突的参考素材 |
MiniMax H3 提示词应该如何构建?
有用的初稿按顺序回答了六个问题:
- 开场画面里有什么?
- 主体做什么?
- 环境如何反应?
- 相机移动到哪里?
- 能听到什么?
- 最后一帧显示了什么?
对于单镜头产品剪辑,可能会变成:
真人工作室产品视频。一个冷柑橘饮料罐直立在深色的石头上。一股狭窄的水流撞击罐子旁边的表面,水花在罐子底部卷曲,而冷凝水则沿着金属向下移动。相机沿顺时针方向缓慢转动一圈,使标签面向镜头。清晰的边缘光,克制的反射。当水沉淀并且罐子居中时,射击结束。
提示描述了原因和结果。水撞击表面,水花在罐子周围移动,然后水滴沉淀下来。 “现实液体物理”不太有用,因为它命名了所需的质量,但没有定义事件。
当您准备好测试提示时,打开 C Dance AI 工作区并选择 MiniMax H3。
H3模式下提示词如何变化?
H3支持多种工作流程,每一种工作流程都需要不同的信息。在每种模式中重复相同的提示会浪费输入资源提供的控制。
文生视频:定义整个镜头
文本转视频没有开场图像来确定主题或构图。描述动作开始前的初始帧。
日出前在一家安静的面包店内拍摄的实景中广角镜头。面包师打开木制百叶窗,将一块热面包放在柜台上,然后在蒸汽升起时切下一片。相机慢慢地推向面包,但高度不变。百叶窗的刮擦声和脆皮的脆响背后,街道的氛围依然微弱。柔和的原声吉他在场景下演奏。最后近距离观察切片面包。
保持开头具体:取景、拍摄对象位置、背景和光线。以运动开始但从未建立场景的提示会迫使模型立即做出太多决定。
图生视频:描述第一帧后发生的变化
上传的图像已经提供了外观和构图。不要花一半的时间来重复每个可见的细节。确定什么必须保持固定,然后描述下一步的动作。
使用上传的图像作为确切的开场框架。保留女人的脸、蓝色羊毛衫、银项链、座位位置和火车车厢布局。她将目光从折叠的信上抬起,看向被雨水覆盖的窗户,然后沿着现有的折痕折叠纸张。当她的倒影穿过玻璃时,摄像机慢慢向右移动。雨水敲打着窗户,盖过火车车轮低沉的节奏。没有背景音乐。
如果您同时提供第一帧和最后一帧,请描述它们之间的物理路径。避免编写两个静态图像描述。解释姿势、物体、相机和灯光如何从开始状态移动到结束状态。
参考生视频:为每项资产分配一份工作
C Dance AI 对接的 H3 服务接口最多支持 9 个图像、3 个视频和 3 个音频文件,总计不超过 12 个文件。公开工作区目前提供文生视频和图生视频;完整的参考素材控制取决于生成时可用的界面。参考素材越多并不代表连续性一定越好,每个文件都应解决一个明确的不确定因素。
使用参考角色,例如:
- 图 1 定义了人的脸部和头发。
- 图 2 定义了服装和调色板。
- 视频 1 提供了身体动作和摄像机节奏。
- 音频 1 提供语音或定时参考。
然后直接写变换:
使用图 1 中的人作为唯一的表演者。保留她的面部比例、黑色短发和红色夹克。遵循视频 1 中的身体动作和拍摄时间,但将动作置于图 2 所示的地铁站台中。保持视频 1 中的摄像机路径和表演者姿势顺序。使用音频 1 进行计时;不要添加背景音乐。
相互冲突的参考是漂移的常见来源。如果两张图像显示不同的服装或脸型,H3 必须决定保留哪些细节。在添加更多提示文本之前删除较弱的引用。
社区H3测试显示了什么?
官方提示规则解释了语法。社区测试表明哪些变量值得早期检查。
一项公共基准测试汇集了 1,000 个 H3 代,涉及多个主题和风格。它的样本网格涵盖了面孔、版式、人群、身体接触、动画、摄像机运动和普通场景。该范围提供了比单个有吸引力的剪辑更多的证据,同时仍然需要检查单个输出是否存在故障。

广泛的多样性可以掩盖个人的失败。为了进行集中评估,请在每次尝试旁边保留输入、持续时间、模式、分辨率和一个更改的变量。
一项单独的社区参考生视频测试将角色、环境和对象参考结合在一个移动场景中。两张图像定义了表演者,一张定义了山地环境,一张定义了自行车。这些角色消除了“两个骑自行车的动漫人物”的通用提示中的四个视觉歧义。
Reddit 用户 irmemon225 创建了此参考工作流程示例。它记录了一个参考集的一个输出;它没有建立平均成功率。
第二个社区测试使用低分辨率和低步数来在最终渲染之前完善提示。草稿通过检查主体数量、摄像机方向、参考角色和拍摄顺序。这些元素稳定后提高质量。
相机运动应该如何写?
选择一个主要的摄像机路径来拍摄短镜头。 H3 可以理解推入、拉出、平移、转向、倾斜、基座、弧线、跟踪、静态取景、摇动、视角、缩放和滚动等动作。
写出场景内的运动:
摄像机在街道上跟踪骑车人旁边,同时保持相同的距离。
避免使用一堆标签,例如:
动态相机、无人机拍摄、轨道、摇摄、变焦、机架对焦
这些指令竞争相同的秒数。如果镜头需要揭示,请说明起始视图、运动以及相机揭示的内容:
特写镜头开始于面包师手上的面粉。镜头慢慢拉回,露出整个工作台和六个成品面包,而面包师继续揉捏。
仅当下一个镜头提供新信息时才使用剪辑。距离的轻微变化通常可以通过相机运动更好地处理。
如何编写多镜头 H3 提示?
6 秒的剪辑无法包含与 15 秒的剪辑相同的故事。在添加细节之前为每个节拍分配时间。
这则 10 秒的产品广告使用了三个镜头:
[镜头 1] 真人广告,黎明前一名跑步者在潮湿的跑道上系鞋带的特写镜头。相机保持低位且静止。布料拉紧,蕾丝轻轻折断。
[镜头 2] 在 00:03.000,切到跑步者加速通过第一个弯道时的侧面跟踪镜头。每个脚步都会从跑道上溅起一小片水花。呼吸和足部的冲击力超越了遥远的城市氛围。
[镜头 3] 00:07.000,切到终点线旁边的鞋子着陆处,然后在跑步者停止时缓慢推进。短暂的低音脉冲以最后的脚步声结束。
剪辑时间留出三秒用于准备,四秒用于主要动作,三秒用于结束。如果添加对话,则必须符合相同的预算。
不要为单个连续镜头中的每个动作添加时间戳。使用它们来标记不同的剪辑或重要的定时事件。
如何提示对话和原生音频?
H3 一起生成视频和原生立体声。当提示区分三个音频层时,它会变得更容易控制:
- 对话:由指定人员说出的确切话语。
- 声景:氛围、脚步声、冲击力、织物、雨、呼吸或机械。
- 背景音乐:观众听到但现场的人听不到的音乐。
对于两个发言者,保持他们的身份稳定:
[镜头 1] 实景拍摄,小火车车厢内的中景镜头。窗边的女士(说话者 1)轻声用英语说道:“我在下一站下车。”门口的售票员低声(说话者2)用英语回答:“我们两分钟后到达。”他们的嘴只在自己的台词中移动。
音景:稳定的车轮噪音、打在玻璃上的小雨和轻柔的打票声。
背景音乐:稀疏的钢琴音符,节奏缓慢,在指挥回应之前逐渐消失。
保持口头文案简短。用计时器大声朗读。如果一个句子需要五秒钟才能说完,那么它就无法自然地与 6 秒视频中的另一句话和几个动作一起出现。
对于画外音,请说它在屏幕外,并且屏幕上的主体的嘴唇保持闭合状态。这减少了 H3 将旁白分配给可见角色的机会。
您可以改编哪些 MiniMax H3 提示示例?
这些提示涵盖了不同的生产问题。替换主题和品牌详细信息,但保留操作逻辑。
垂直创作者演示
明亮公寓中的垂直实景电话视频。一位女士面对着镜头,右手拿着一个紧凑的手持式真空吸尘器。她用左手食指指着喷嘴,向沙发弯腰,一口气清除了一行面包屑。该相机具有轻微的手持移动功能,但可以将她的手和产品保持在画面中。自然窗户光。当喷嘴到达沙发时电机启动,然后在末端停止。没有剪辑,也没有背景音乐。
第一帧时尚动画
使用上传的肖像作为确切的第一帧。保留模特的脸、辫子、绿色外套以及她身后街道的位置。她把肩膀转向道路,迈出两步,然后回头看向左肩。相机以步行速度向后追踪并保持全身构图。风将外套下摆向与她转动的方向相同的方向移动。最后,她的脸以四分之三的侧面可见。
肢体动作场景
在空荡荡的仓库里进行的真人全身拍摄。一名特技演员跑向一个低矮的木栅栏,双脚落地,越过栅栏,弯曲膝盖着地,翻过右肩,然后起身奔跑。灰尘在撞击时升起并落在他身后。一台稳定的手持摄像机从三米后跟踪他,但没有追上他。透过高高的窗户的硬侧光。一张包含脚步声、衣服运动、着陆冲击力的连续镜头,没有音乐。
以参考为主导的角色替换
使用视频 1 作为拍摄时间、摄像机角度、身体运动和背景动作的来源。仅将视频 1 中的表演者替换为图像 1 定义的人物。在整个剪辑中保留图像 1 中的面部、头发、衣服和身体比例。保持视频 1 中的所有其他人、物体、摄像机移动和环境声音不变。不要复制图像 1 中的背景。
最后的例子需要参考模式。普通的图生视频提示没有要保留源视频的时间和动作。
为什么MiniMax H3忽略提示指令?
当输出失败时,更改解释失败的最小指令。
| 失败 | 可能提示问题 | 第一次修订 |
|---|---|---|
| 随机剪切 | 多个镜头移动或场景变化相互竞争 | 请求一张连续镜头和一个摄像机路径 |
| 错误的人说话 | 演讲者的识别不一致 | 为每个发言者分配一个稳定的标签并缩短交流时间 |
| 对话变得仓促 | 线路对于持续时间来说太长 | 大声计时或增加剪辑长度 |
| 产品变形 | 动作、摄像机和造型使镜头超载 | 锁定产品方向并消除二次运动 |
| 参考身份漂移 | 参考文献冲突或角色不明确 | 保留最清晰的身份形象并说明剩余的每个角色 |
| 第一帧和最后一帧不连接 | 缺少物理过渡 | 描述中间姿势、物体和相机的变化 |
| 声音感觉不相关 | 音频仅表达为一种情绪 | 命名来源、时间和音量变化 |
每次失败后不要重写整个提示。如果相机错误但主题保持一致,请保留主题语言并修改相机句子。这使得每次重试都提供丰富的信息。
您应该选择哪个持续时间和分辨率?
当前的 C Dance AI 集成接受 4 到 15 秒的整数持续时间。它提供768P和2K输出,默认是6秒2K生成。
当前基本信用计算:
| 环境 | 制作人员 |
|---|---|
| 768P | 每秒输出 50 个 |
| 2K | 每秒输出 80 个 |
| 前五张之后的每个参考图像 | 25个额外学分 |
因此,6 秒文生视频的生成从 768P 中的 300 个积分或 2K 中的 480 个积分开始。根据参考合同,参考生视频持续时间和额外的参考图像可以增加总数。工作区显示提交前的计算。
在能够保持动作和对话的最短时间内起草。当最终细节还不是问题时,请使用 768P 进行早期构图测试。提示的时间和相机行为稳定后移至 2K。
生成之前应该检查什么?
阅读一次提示并确认:
- 开放框架清晰。
- 该剪辑有一个主要动作。
- 原因和可见的效果都被描述。
- 相机指令不冲突。
- 剪辑适合选定的持续时间。
- 每个演讲者和推荐人都保留一个身份。
- 对话可以及时进行。
- 氛围和音乐有不同的工作。
- 最终状态是可见且可实现的。
然后返回 C Dance AI 首页,或者打开已选中 MiniMax H3 的生成工作台。每次尝试时保存提示词和设置,用简单语言记录失败情况,并在重试前只调整一个变量。
MiniMax H3 提示词常见问题
MiniMax H3 提示应包含哪些内容?
从主题和可见动作开始,然后定义剪辑所需的设置、摄像机路径、镜头顺序、对话、物理声音和背景音乐。保持每条指令与选定的持续时间兼容。
C Dance AI 中的 MiniMax H3 视频最长可生成多少秒?
当前的 C Dance AI 集成接受 4 到 15 秒的整数持续时间,并提供 768P 和 2K 输出。
MiniMax H3 是否生成音频?
是的。MiniMax H3 可以随视频生成原生立体声音频。提示词可以分别指定对话、氛围、物理音效和背景音乐。
MiniMax H3 可以使用图像、视频和音频参考吗?
H3 服务接口支持图像、视频和音频参考。C Dance AI 当前公开工作区提供文生视频和图生视频;完整的参考素材控制取决于生成时可用的界面。
MiniMax H3中如何提示对话?
一致地识别每个说话者,写下准确的台词,指定语言,并为台词留出足够的时间。将对话与氛围和背景音乐分开,使他们的角色保持清晰。
为什么 MiniMax H3 忽略部分提示?
提示可能包含太多动作、相互冲突的摄像机移动、不明确的参考角色或超出剪辑所能容纳的对话。删除辅助指令并一次测试一项更改。

