MiniMax H3 Prompt 到底怎么写(人话版)
把 Prompt 当成视听脚本而非 ChatGPT caption — 心智模型、最低必要区块,以及如何选对模式。
大多数人带着 文生图习惯 进来:一句漂亮话,点生成,碰运气。MiniMax H3 不同 — 它一次请求可输出最长 15 秒 2K 视频与内置立体声(对白、拟音、环境、配乐)。所以你的 Prompt 更接近 短制作脚本,而不是 Stable Diffusion 标签列表。
我们阅读了 MiniMax 官方手册、GitHub 示例与早期社区测试。下面是 正常人能读懂的压缩版 — 官方术语只在需要映射 API 时出现。
一句话心智模型
按秒描述屏幕上发生什么,以及麦克风该听到什么 — 顺序不能颠倒。
若只写「电影感奢华氛围」,H3 仍会生成 — 但摄影、节奏与音频都是猜的。
先选模式(能省几小时)
| 你手头有… | 用这个模式 | 写什么 |
|---|---|---|
| 只有文字 | T2VA(文生视频) | 镜头列表 + 声音 + 配乐 |
| 一张 hero 图 | I2VA | 「从这帧开始,然后…」+ 镜头列表 |
| 首帧与末帧 | FL2VA | 两帧之间的路径 — 通常 无切镜 |
| 产品图、模特、动作参考 | Ref2VA | 「Image 1 = 脸,Image 2 = 产品…」+ 时间线 |
广告经验法则: 若已有 pack shot 或模特照,Ref2VA 几乎总是优于纯文本。
最低可用结构(纯文本)
T2VA / I2VA / FL2VA 需要三个区块。官方文档称 integrated_multimodal_description、overall_soundscape、non_diegetic_music — 我们叫:
- 镜头列表 — 镜头看到什么、何时(
[Shot 1] 0–3s: …) - 场景内声音 — 雨、脚步、对白、引擎 — 角色能听到的
- 背景音乐 — 观众听到的配乐;只要自然声就写
N/A
下限长度: 主体 + 地点 + 动作 + 风格。官方指南中低于约 200 字符是已知失败模式 — 不是「极简艺术」。
最低可用结构(有参考文件)
Ref2VA 在镜头列表前多一步 不可省略:
告诉 H3 每个上传文件的职责。
- 「@image1 = 锁定瓶身标签」
- 「@video1 = 只复制 orbit 速度,忽略视频里的人」
未标注的上传是「它忽略了我产品图」的 头号原因。
然后写:References → Core idea → Timed process → Sound → Music。
弱 vs 强(同一创意)
弱
Beautiful cinematic perfume ad, luxury feel, 4K.
强
0–3s: 黑大理石上升瓶身,侧光。3–6s: 硬切 — 同瓶日落露台,标签一致。Sound: 玻璃轻敲,傍晚蟋蟀。Music: 慢钢琴,6s 一个和弦。
第二版给 H3 决策,不是形容词。
接下来读什么
- Ref2VA — 产品与模特照 — 商业 playbook
- T2VA 镜头列表 — 无素材时
- 声音怎么写 — 对白 vs 配乐放哪
- 常见错误 — 社区 + 官方失败模式
然后打开 商业模板,读 How this prompt is built,再改 — 不要盲复制。
打开 Prompt 工作台
无需背字段名,把简报映射到官方结构: