为什么 H3 的 Prompt 写法和传统 AI 视频不一样?
MiniMax H3 不是一个简单的「文字转视频」工具。它支持 最多 9 张图片 + 3 段视频 + 3 段音频 的多模态混合输入,原生输出 2K 分辨率、15 秒时长,并且内置了字幕渲染、配乐同步、对口型等能力。
这意味着,传统的「一段描述出一个画面」的 prompt 思维已经不够用了。你需要像一个导演一样,用提示词告诉它:
- 什么时间发生什么(时间轴控制)
- 谁在哪里做什么(角色+环境锁定)
- 画面的节奏和氛围是什么(运动参考+风格指令)
下面这 7 个技巧,全部来自 X 上真实创作者的实践,附带原帖链接与成片截帧,你可以直接对照学习。
技巧一:把时间轴写进 Prompt,控制节奏和转场
核心思路: 不只是描述「一个画面」,而是描述「一条时间线」。
在传统 AI 视频工具中,你只能描述一个静态场景。但 H3 允许你在 prompt 中写入时间码节点,直接控制画面在不同时间点的变化。
实战案例:动漫片头 + 提示词配乐
创作者 @fal 用 5 张静帧生成了一条 15 秒的动漫片头。他的关键技巧是:在提示词里直接写配乐的时间节点。

成片截帧:片头高潮处的标题卡与字幕(原帖视频约 12s 处)。文字清晰可读,正是时间轴 + 配乐节点共同作用的结果。
`` 画面从黑屏渐入,背景出现城市天际线轮廓。 低频鼓点在第 3 秒敲响,画面随节奏推进到角色特写。 爵士贝斯在第 6 秒加入,镜头拉远展示全景。 弦乐在第 12 秒推向高潮,画面切换为标题卡。 ``
关键要点:
- 用「第 X 秒」这样的时间锚点来分割节奏
- 把音乐节拍和画面变化绑定在一起
- 每个时间节点对应一个明确的视觉动作
> 原帖:@fal — 动漫片头

技巧二:双图锁身份与环境,保持角色一致性
核心思路: 用两张参考图分别锁定「角色」和「场景」,避免 AI 自由发挥导致人物走样。
AI 视频最大的痛点之一是角色一致性——同一个角色在不同镜头里长相不同。H3 的多图参考输入提供了一个优雅的解法:分工锁定。
实战案例:写实惊悚短片
创作者 @Diplomeme 制作了一段写实战争惊悚短片,用了两张参考图:
| 参考图 1:锁定角色身份 | 参考图 2:锁定环境基调 |
|---|---|
![]() | ![]() |
- Image 1: 锁定角色的面部特征、服装、发型
- Image 2: 锁定桥梁、城市环境、整体色调
然后在 prompt 中写入分镜时间码,让 AI 按照他的剪辑节奏生成画面。

成片截帧:身份与环境被双图锁定后的连贯画面——同一角色、同一城市、同一黎明色调。
``` 参考图 1 为角色 A,保持其面部特征和服装不变。 参考图 2 为城市桥梁环境,作为全片背景基调。
[0s-4s] 角色 A 站在桥头,低头看向河面,逆光剪影。 [4s-8s] 镜头缓慢推近,角色抬头,表情紧张。 [8s-15s] 角色转身奔跑,镜头跟随,城市天际线在背景中展开。 ```
关键要点:
- 每张参考图只负责一个维度(人物 OR 环境),不要混用
- 在 prompt 中明确指定「保持 XX 不变」,强化锁定指令
- 分镜时间码让 AI 知道每个镜头的起止时间
> 原帖:@Diplomeme — 写实惊悚短片
技巧三:屏幕文字不糊的秘诀——专门强调文字可读性
核心思路: 在 prompt 中单独用一句话强调 on-screen text 的清晰度和可读性。
很多 AI 视频模型生成的文字都是「看起来像字但不是字」的伪文字。H3 在文字渲染上有明显优势,但前提是你需要在 prompt 中明确要求。
实战案例一:动漫 OP 大字标题
创作者 @slash1sol 制作了一段动漫风格的片头,屏幕上出现了清晰的标题文字。他的关键做法是在 prompt 中强调:

成片截帧:角色身后巨大的 ARDEN VOSS 字样边缘锐利,动态中仍可辨认——这是 H3 文字渲染能力的代表作之一。
`` 屏幕中央出现标题文字「XXX」,字体清晰锐利,边缘无模糊, 白色文字带黑色描边,确保在动态画面中保持可读性。 ``
实战案例二:法国客户广告中的手机 UI 文字
创作者 @0xInk_ 为客户制作广告时,主片用了其他模型,但手机滚动文字的镜头专门用 H3 生成,因为 H3 的文字更干净、更可控。

成片截帧:广告成片中的产品/场景镜头。原帖特别提到:手机滚动 UI 文字用 H3 单独生成,文字更干净。
`` 手机屏幕显示滚动的法语文本,字体为无衬线体, 文字清晰可读,滚动速度均匀,屏幕反光自然。 ``
关键要点:
- 在 prompt 中单独用一句话强调「清晰」「锐利」「可读」
- 指定字体风格(衬线/无衬线)和颜色(白字黑边等)
- 如果整条视频不需要全部文字清晰,可以只让关键镜头用 H3 生成
> 原帖: > > - @slash1sol — 动漫 OP 大字标题 > - @0xInk_ — 法国客户广告
技巧四:多模态参考的正确用法——图+视频+音频的组合拳
核心思路: 不要只用文字描述,用参考图给画面、参考视频给节奏、参考音频给气氛。
H3 的 Omni 多模态能力是它最大的差异化卖点之一。你可以同时输入图片、视频和音频作为参考,让 AI 综合理解你想要的效果。
实战案例一:六图资产 + 参考视频节奏合成
创作者 @influencer_seo 的做法非常聪明:
- 6 张图片作为视觉积木,每张代表一个镜头的视觉参考
- 1 段参考视频不用于画面,而是给节奏、转场和音乐气氛

`` 参考图 1-6 分别为 6 个镜头的视觉参考。 参考视频用于提取剪辑节奏和转场风格,不要直接复制画面。 整体节奏:前 5 秒慢推,中间 7 秒快切,最后 3 秒定格。 ``
实战案例二:Omni Reference 商用讲解
创作者 @YaseenK7212 展示了一个完整的 Omni 工作流:文本描述意图 + 图片锁定画面 + 音频控制氛围 + 视频给运动参考。他特别强调了「一致性」——多模态输入的核心价值不是「更多素材」,而是「更一致的输出」。

实战案例三:AE 粗动画驱动真实画面
创作者 @seiiiiiiiiiiru 用 After Effects 做了一个粗糙的图形动画,然后把它作为运动参考输入 H3。AI 不会复制 AE 的画面,而是学习它的运动节奏和方向,然后把这种运动「施加」到你提供的静帧上。

`` 参考视频为运动参考,提取其运动节奏和方向。 画面内容以参考图为准,保持静帧的构图和色调。 按照参考视频的节奏让画面缓慢运动。 ``
关键要点:
- 图片 = 画面内容,视频 = 运动/节奏,音频 = 氛围/情绪
- 在 prompt 中明确每个参考的用途(「参考图用于画面」「参考视频用于节奏」)
- 不要让 AI 猜你的意图,直接说清楚每个输入的角色
> 原帖: > > - @influencer_seo — 六图+视频合成 > - @YaseenK7212 — Omni 商用讲解 > - @seiiiiiiiiiiru — AE 驱动静帧
技巧五:单图 + Prompt 直出产品广告
核心思路: 一张好的产品图,配合结构化的 prompt,就能直接生成 15 秒的商用广告。
这是电商卖家最关心的场景——不需要拍摄团队,一张产品图就够。
实战案例:单图生成 15 秒产品广告
创作者 @ai_for_success 展示了一张产品图直接生成 15 秒广告的过程。关键的 prompt 结构是:

成片截帧:单图生成的商用级产品镜头——珊瑚、海龟与手表同框,表盘文字清晰。
``` 产品图作为主视觉参考。
镜头从产品正面开始,缓慢环绕拍摄,展示产品细节。 背景为浅灰色渐变,光线柔和,营造高级质感。 第 8 秒镜头推近到产品 LOGO 特写。 第 12 秒拉远,展示产品全貌,背景出现品牌标语。 整体风格:简洁、高级、商业广告质感。 ```
同样,创作者 @thisismariaa25 用菜单概念图生成了一段夏日竖屏餐饮视频,适合本地生活和电商场景。

关键要点:
- 产品图的构图和光线质量直接决定输出质量
- 在 prompt 中指定镜头运动(环绕、推近、拉远)
- 明确背景风格和整体氛围(「简洁」「高级」「商业广告质感」)
- 竖屏内容加
9:16或「竖屏」指令
> 原帖: > > - @ai_for_success — 单图产品广告 > - @thisismariaa25 — 夏日菜单竖屏
技巧六:风格融合的 Prompt 结构——打破单一风格的局限
核心思路: 用两到三个风格关键词的组合,创造出独一无二的视觉语言。
H3 的风格理解能力很强,你可以把看似不搭的风格拼在一起,产生惊喜。
实战案例一:时尚 editorial × 地下说唱 MV
创作者 @Strength04_X 把三种视觉语言融合在一起:

`` 时尚 editorial 质感 + cyber-grunge 字体 + 地下说唱 MV 剪辑节奏。 画面在高端时装秀场和地下停车场之间切换。 字体风格:粗体无衬线,带霓虹光晕。 色调:高对比,暗部偏青,亮部偏橙。 ``
实战案例二:实拍照片 × 插画融合
创作者 @aichof21 用一张实拍 snap 照片作为参考,让 H3 生成了「照片逐渐融化为插画」的动态效果:

`` 参考图为实拍照片。 画面从写实照片开始,逐渐过渡为手绘插画风格。 过渡过程中保持构图不变,只改变画面的笔触和色彩。 最终画面为水彩插画风格,保留照片的光影关系。 ``
实战案例三:二次元原创短片
创作者 @hafuma 制作了一段二次元角色驱动的短片。他的风格指令非常明确:

`` 日式动画风格,赛璐珞着色,线条清晰。 角色表情丰富,动作流畅。 背景为新海诚式光影,天空有丁达尔效应。 ``
关键要点:
- 风格融合不是「随便混」,而是用 2-3 个明确的风格标签组合
- 在 prompt 中指定色调(「暗部偏青」「亮部偏橙」)比说「好看」有用 100 倍
- 参考知名创作者/作品的风格名称(「新海诚式」「赛璐珞着色」)能大幅提升准确度
> 原帖: > > - @Strength04_X — 时尚×说唱 MV > - @aichof21 — 实拍×插画融合 > - @hafuma — 二次元原创短片
技巧七:分镜时间码——让 AI 按你的剪辑节奏走
核心思路: 把 15 秒的视频拆成 3-5 个时间段,每个时间段写一个分镜描述。
这是所有技巧中最「导演思维」的一个。当你把时间码写进 prompt,AI 就不再是在「猜」你想要什么,而是在「执行」你的分镜表。
实战案例一:喷气机编队航拍
创作者 @Kuriyama890 制作了一段三机编队航拍视频,镜头切换非常流畅。他的 prompt 结构:

成片截帧:三机编队拉出尾迹,天空中的云字写着 “is coming”——分镜时间码 + 文字渲染同时生效。
`` [0s-3s] 广角航拍,三架战斗机以 V 字编队飞过雪山。 [3s-7s] 切换到座舱特写,飞行员戴上头盔。 [7s-11s] 编队拉升,喷出白色尾迹。 [11s-15s] 仰角镜头,三架飞机在天空中拉出「H3」字样。 ``
实战案例二:故事预告片向商业成片
创作者 @john_my07 强调了 H3 在 prompt following、文字渲染和运镜控制上的综合能力,他的做法是把预告片的经典结构写进 prompt:

`` [0s-4s] 黑屏,白色字幕淡入片名。 [4s-8s] 快速闪切 3 个场景镜头,每个约 1.3 秒。 [8s-12s] 主角正面特写,缓慢推近。 [12s-15s] 黑屏,出现上映日期文字。 ``
关键要点:
- 每个时间段 3-5 秒,不要太短(AI 来不及完成动作)也不要太长(节奏拖沓)
- 每个时间段只描述一个核心动作或镜头变化
- 开头和结尾可以加「黑屏渐入」「淡出黑屏」来增加电影感
- 时间码的写法:
[0s-3s]、[3s-7s]、[7s-15s],注意不要有间隙
> 原帖: > > - @Kuriyama890 — 喷气机编队航拍 > - @john_my07 — 故事预告片
更多值得学习的案例
除了上面 7 个核心技巧对应的案例,还有几个值得关注的实践:
电影感多镜头试片 — @maxescu
约 280 赞,展示了 H3 的 cinematic 上限。原帖还附带了多段极详细的分镜 prompt(时间轴、镜头、物理、灯光、对白全部写死),非常值得精读。

日文规格科普 + 成片 — @seiiiiiiiiiiru
日语社区的标杆案例,兼具产品规格说明与成片演示。

PixVerse 平台合作 Demo — @PixVerse_
产品宣发级成片,适合对照平台官方 demo 的风格上限。

| 案例 | 创作者 | 亮点 | 原帖 |
|---|---|---|---|
| 电影感多镜头试片 | @maxescu | 高赞 cinematic 上限 + 超长分镜 prompt | 链接 |
| 日文规格科普+成片 | @seiiiiiiiiiiru | 日语社区标杆 | 链接 |
| 竖屏角色对口型 | @qaHEqxyzUF99214 | 对口型(lip-sync)尝试 | 链接 |
| PixVerse 平台合作 Demo | @PixVerse_ | 产品宣发级成片 | 链接 |
| 纯文生 2K 15 秒测试 | @MrDavids1 | T2V 入门体验 | 链接 |
| MV 制作向实验 | @apilpirman | 用 H3 做 MV 的探索 | 链接 |
总结:H3 Prompt 的黄金公式
把上面 7 个技巧浓缩成一个公式:
`` [时间轴] + [镜头运动] + [画面内容] + [风格/色调] + [参考图/视频/音频说明] ``
一个完整的 prompt 示例:
``` 参考图 1 为角色 A(女性,黑色短发,白色衬衫)。 参考图 2 为办公室环境(落地窗,城市天际线)。 参考视频用于提取运镜节奏。
[0s-4s] 中景,角色 A 坐在办公桌前,低头看电脑,自然光从落地窗洒入。 [4s-8s] 角色抬头,表情惊讶,镜头缓慢推近到面部特写。 [8s-12s] 角色站起身,走向落地窗,镜头跟随。 [12s-15s] 角色背影站在窗前,城市天际线在窗外展开,画面定格。
整体风格:电影感,色调偏冷,浅景深,自然光线。 ```
最后的建议:
- 先写分镜,再填细节。 把 15 秒拆成 3-5 个时间段,先确定每个时间段的核心动作。
- 参考图要分工。 人物一张、环境一张、风格参考一张,不要混在一起。
- 风格指令要具体。 说「赛璐珞着色,新海诚式光影」比说「动漫风格」有用得多。
- 多模态输入不是越多越好。 每个输入都要有明确的角色(画面/节奏/氛围),否则会互相干扰。
- 善用文字渲染能力。 如果你的视频需要标题、字幕或 UI 文字,H3 是目前最好的选择之一。





