官方指南
MiniMax 发布了两份官方提示词编写指南:- 基础生成模式(T2VA、I2VA、FL2VA、L2VA):将提示词组织为带时长的镜头,并配合镜头运动与音频(对话、音效、音乐),每种模式都配有示例
- 全参考模式(R2V):重写输出的结构,包括主体定义、参考标签和保留分析,以及如何为每个参考在目标镜头中分配角色
通用技巧
- 描述整个场景:先交代整体场景(地点、人物、正在发生什么),再将其拆分为带时长的各个镜头
- 镜头、镜头运动与音频:在一个提示词块中描述镜头、镜头运动以及相应的音频(对话、音效、音乐)
- 分辨率:H3 的原生画布短边为 768px,16:9 下为 1344x768,分辨率会取整为 32 的倍数。参见设置输出分辨率
- 时长:时长输入会吸附到模型在 24fps 下的每块 17 帧(17k+5)网格上
- 屏幕可见文字用引号:画面中实际可见的文字(招牌、横幅、字幕、霓虹文字)都要用英文双引号包裹,并逐条单独列出。社区实测:把每段文字都用引号枚举出来能保持文字清晰可读,未定义的文字则容易变成乱码符号。这符合官方基础指南的屏幕文字规则。对白请改用
<d>标签:引号用于印刷文字,<d>用于角色说的话 - R2V 中的音频复用标记:在全参考(R2V)提示词中,用标记声明音频与目标视频的关系,写进保留分析:
fully_copy表示源音频 1:1 用作最终音轨,reference只沿用音色和语气。社区实测:标记不正确时,H3 只把音频当音色参考,口型会与歌词脱节。参见官方全参考指南的关系标记表
提示词嵌入
Comfy-Org/ComfyUI#15697 为 MiniMax H3 加入了提示词嵌入支持。你可以在 H3 提示词中使用 ComfyUI 标准的embedding: 语法。
将嵌入文件放在 ComfyUI/models/embeddings/ 中,然后在提示词中按名称引用即可,例如 embedding:my_embedding。该嵌入会像其他任何 ComfyUI 模型一样被加载并混入文本条件中。
Comfy-Org/MiniMax-H3 仓库的 embeddings 文件夹中托管了 10 个风格嵌入。这些文件并非官方文件:它们由社区成员 silveroxides 通过 Hugging Face PR #50 贡献,并非由 Comfy-Org 或 MiniMax 制作。原始文件位于 silveroxides/MiniMax-H3_tests 仓库中。文件名描述了预期效果,触发词是不带扩展名的文件名: