返回指南列表

MiniMax H3 Prompt 到底怎么写(人话版)

把 Prompt 当成视听脚本而非 ChatGPT caption — 心智模型、最低必要区块,以及如何选对模式。

大多数人带着 文生图习惯 进来:一句漂亮话,点生成,碰运气。MiniMax H3 不同 — 它一次请求可输出最长 15 秒 2K 视频与内置立体声(对白、拟音、环境、配乐)。所以你的 Prompt 更接近 短制作脚本,而不是 Stable Diffusion 标签列表。

我们阅读了 MiniMax 官方手册、GitHub 示例与早期社区测试。下面是 正常人能读懂的压缩版 — 官方术语只在需要映射 API 时出现。


一句话心智模型

按秒描述屏幕上发生什么,以及麦克风该听到什么 — 顺序不能颠倒。

若只写「电影感奢华氛围」,H3 仍会生成 — 但摄影、节奏与音频都是猜的。


先选模式(能省几小时)

你手头有…用这个模式写什么
只有文字T2VA(文生视频)镜头列表 + 声音 + 配乐
一张 hero 图I2VA「从这帧开始,然后…」+ 镜头列表
首帧与末帧FL2VA两帧之间的路径 — 通常 无切镜
产品图、模特、动作参考Ref2VA「Image 1 = 脸,Image 2 = 产品…」+ 时间线

广告经验法则: 若已有 pack shot 或模特照,Ref2VA 几乎总是优于纯文本。


最低可用结构(纯文本)

T2VA / I2VA / FL2VA 需要三个区块。官方文档称 integrated_multimodal_description、overall_soundscape、non_diegetic_music — 我们叫:

  1. 镜头列表 — 镜头看到什么、何时([Shot 1] 0–3s: …)
  2. 场景内声音 — 雨、脚步、对白、引擎 — 角色能听到的
  3. 背景音乐 — 观众听到的配乐;只要自然声就写 N/A

下限长度: 主体 + 地点 + 动作 + 风格。官方指南中低于约 200 字符是已知失败模式 — 不是「极简艺术」。


最低可用结构(有参考文件)

Ref2VA 在镜头列表前多一步 不可省略:

告诉 H3 每个上传文件的职责。

  • 「@image1 = 锁定瓶身标签」
  • 「@video1 = 只复制 orbit 速度,忽略视频里的人」

未标注的上传是「它忽略了我产品图」的 头号原因。

然后写:References → Core idea → Timed process → Sound → Music。


弱 vs 强(同一创意)

弱

Beautiful cinematic perfume ad, luxury feel, 4K.

强

0–3s: 黑大理石上升瓶身,侧光。3–6s: 硬切 — 同瓶日落露台,标签一致。Sound: 玻璃轻敲,傍晚蟋蟀。Music: 慢钢琴,6s 一个和弦。

第二版给 H3 决策,不是形容词。


接下来读什么

  1. Ref2VA — 产品与模特照 — 商业 playbook
  2. T2VA 镜头列表 — 无素材时
  3. 声音怎么写 — 对白 vs 配乐放哪
  4. 常见错误 — 社区 + 官方失败模式

然后打开 商业模板,读 How this prompt is built,再改 — 不要盲复制。


打开 Prompt 工作台

无需背字段名,把简报映射到官方结构:

构建官方导出(首页)→ · Ref2VA playbook · T2VA 镜头列表