30:00:00

注册送 10 积分 · 年付 20% OFF

查看年付方案
教程

MiniMax H3 提示词实战手册:从 X 上 20 个热门案例学到的 7 个核心技巧

M

AI 视频生成与工作室工作流指南。

22 分钟
MiniMax H3 提示词实战手册:从 X 上 20 个热门案例学到的 7 个核心技巧

MiniMax H3 不是一个简单的「文字转视频」工具。它支持 最多 9 张图片 + 3 段视频 + 3 段音频 的多模态混合输入,原生输出 2K 分辨率、15 秒时长,并且内置了字幕渲染、配乐同步、对口型等能力。

为什么 H3 的 Prompt 写法和传统 AI 视频不一样?

MiniMax H3 不是一个简单的「文字转视频」工具。它支持 最多 9 张图片 + 3 段视频 + 3 段音频 的多模态混合输入,原生输出 2K 分辨率、15 秒时长,并且内置了字幕渲染、配乐同步、对口型等能力。

这意味着,传统的「一段描述出一个画面」的 prompt 思维已经不够用了。你需要像一个导演一样,用提示词告诉它:

  • 什么时间发生什么(时间轴控制)
  • 谁在哪里做什么(角色+环境锁定)
  • 画面的节奏和氛围是什么(运动参考+风格指令)

下面这 7 个技巧,全部来自 X 上真实创作者的实践,附带原帖链接与成片截帧,你可以直接对照学习。


技巧一:把时间轴写进 Prompt,控制节奏和转场

核心思路: 不只是描述「一个画面」,而是描述「一条时间线」。

在传统 AI 视频工具中,你只能描述一个静态场景。但 H3 允许你在 prompt 中写入时间码节点,直接控制画面在不同时间点的变化。

实战案例:动漫片头 + 提示词配乐

创作者 @fal 用 5 张静帧生成了一条 15 秒的动漫片头。他的关键技巧是:在提示词里直接写配乐的时间节点

@fal 动漫片头成片截帧:BRIDGE 标题卡 + 日英双语文案,时间轴驱动的片头节奏

成片截帧:片头高潮处的标题卡与字幕(原帖视频约 12s 处)。文字清晰可读,正是时间轴 + 配乐节点共同作用的结果。

`` 画面从黑屏渐入,背景出现城市天际线轮廓。 低频鼓点在第 3 秒敲响,画面随节奏推进到角色特写。 爵士贝斯在第 6 秒加入,镜头拉远展示全景。 弦乐在第 12 秒推向高潮,画面切换为标题卡。 ``

关键要点:

  • 用「第 X 秒」这样的时间锚点来分割节奏
  • 把音乐节拍和画面变化绑定在一起
  • 每个时间节点对应一个明确的视觉动作

> 原帖:@fal — 动漫片头

原帖截图 @fal

技巧二:双图锁身份与环境,保持角色一致性

核心思路: 用两张参考图分别锁定「角色」和「场景」,避免 AI 自由发挥导致人物走样。

AI 视频最大的痛点之一是角色一致性——同一个角色在不同镜头里长相不同。H3 的多图参考输入提供了一个优雅的解法:分工锁定

实战案例:写实惊悚短片

创作者 @Diplomeme 制作了一段写实战争惊悚短片,用了两张参考图:

参考图 1:锁定角色身份参考图 2:锁定环境基调
角色参考图环境参考图
  • Image 1: 锁定角色的面部特征、服装、发型
  • Image 2: 锁定桥梁、城市环境、整体色调

然后在 prompt 中写入分镜时间码,让 AI 按照他的剪辑节奏生成画面。

@Diplomeme 成片截帧:角色在屋顶操作天线,黄昏城市与烟尘

成片截帧:身份与环境被双图锁定后的连贯画面——同一角色、同一城市、同一黎明色调。

``` 参考图 1 为角色 A,保持其面部特征和服装不变。 参考图 2 为城市桥梁环境,作为全片背景基调。

[0s-4s] 角色 A 站在桥头,低头看向河面,逆光剪影。 [4s-8s] 镜头缓慢推近,角色抬头,表情紧张。 [8s-15s] 角色转身奔跑,镜头跟随,城市天际线在背景中展开。 ```

关键要点:

  • 每张参考图只负责一个维度(人物 OR 环境),不要混用
  • 在 prompt 中明确指定「保持 XX 不变」,强化锁定指令
  • 分镜时间码让 AI 知道每个镜头的起止时间

> 原帖:@Diplomeme — 写实惊悚短片


技巧三:屏幕文字不糊的秘诀——专门强调文字可读性

核心思路: 在 prompt 中单独用一句话强调 on-screen text 的清晰度和可读性。

很多 AI 视频模型生成的文字都是「看起来像字但不是字」的伪文字。H3 在文字渲染上有明显优势,但前提是你需要在 prompt 中明确要求。

实战案例一:动漫 OP 大字标题

创作者 @slash1sol 制作了一段动漫风格的片头,屏幕上出现了清晰的标题文字。他的关键做法是在 prompt 中强调:

@slash1sol 成片截帧:ARDEN VOSS 巨型标题文字清晰可读

成片截帧:角色身后巨大的 ARDEN VOSS 字样边缘锐利,动态中仍可辨认——这是 H3 文字渲染能力的代表作之一。

`` 屏幕中央出现标题文字「XXX」,字体清晰锐利,边缘无模糊, 白色文字带黑色描边,确保在动态画面中保持可读性。 ``

实战案例二:法国客户广告中的手机 UI 文字

创作者 @0xInk_ 为客户制作广告时,主片用了其他模型,但手机滚动文字的镜头专门用 H3 生成,因为 H3 的文字更干净、更可控。

@0xInk_ 法国客户广告成片截帧

成片截帧:广告成片中的产品/场景镜头。原帖特别提到:手机滚动 UI 文字用 H3 单独生成,文字更干净。

`` 手机屏幕显示滚动的法语文本,字体为无衬线体, 文字清晰可读,滚动速度均匀,屏幕反光自然。 ``

关键要点:

  • 在 prompt 中单独用一句话强调「清晰」「锐利」「可读」
  • 指定字体风格(衬线/无衬线)和颜色(白字黑边等)
  • 如果整条视频不需要全部文字清晰,可以只让关键镜头用 H3 生成

> 原帖: > > - @slash1sol — 动漫 OP 大字标题 > - @0xInk_ — 法国客户广告


技巧四:多模态参考的正确用法——图+视频+音频的组合拳

核心思路: 不要只用文字描述,用参考图给画面、参考视频给节奏、参考音频给气氛。

H3 的 Omni 多模态能力是它最大的差异化卖点之一。你可以同时输入图片、视频和音频作为参考,让 AI 综合理解你想要的效果。

实战案例一:六图资产 + 参考视频节奏合成

创作者 @influencer_seo 的做法非常聪明:

  • 6 张图片作为视觉积木,每张代表一个镜头的视觉参考
  • 1 段参考视频不用于画面,而是给节奏、转场和音乐气氛
@influencer_seo 六图+视频节奏合成成片截帧

`` 参考图 1-6 分别为 6 个镜头的视觉参考。 参考视频用于提取剪辑节奏和转场风格,不要直接复制画面。 整体节奏:前 5 秒慢推,中间 7 秒快切,最后 3 秒定格。 ``

实战案例二:Omni Reference 商用讲解

创作者 @YaseenK7212 展示了一个完整的 Omni 工作流:文本描述意图 + 图片锁定画面 + 音频控制氛围 + 视频给运动参考。他特别强调了「一致性」——多模态输入的核心价值不是「更多素材」,而是「更一致的输出」。

@YaseenK7212 Omni 多模态成片截帧

实战案例三:AE 粗动画驱动真实画面

创作者 @seiiiiiiiiiiru 用 After Effects 做了一个粗糙的图形动画,然后把它作为运动参考输入 H3。AI 不会复制 AE 的画面,而是学习它的运动节奏和方向,然后把这种运动「施加」到你提供的静帧上。

@seiiiiiiiiiiru AE 运动参考驱动静帧成片截帧

`` 参考视频为运动参考,提取其运动节奏和方向。 画面内容以参考图为准,保持静帧的构图和色调。 按照参考视频的节奏让画面缓慢运动。 ``

关键要点:

  • 图片 = 画面内容,视频 = 运动/节奏,音频 = 氛围/情绪
  • 在 prompt 中明确每个参考的用途(「参考图用于画面」「参考视频用于节奏」)
  • 不要让 AI 猜你的意图,直接说清楚每个输入的角色

> 原帖: > > - @influencer_seo — 六图+视频合成 > - @YaseenK7212 — Omni 商用讲解 > - @seiiiiiiiiiiru — AE 驱动静帧


技巧五:单图 + Prompt 直出产品广告

核心思路: 一张好的产品图,配合结构化的 prompt,就能直接生成 15 秒的商用广告。

这是电商卖家最关心的场景——不需要拍摄团队,一张产品图就够。

实战案例:单图生成 15 秒产品广告

创作者 @ai_for_success 展示了一张产品图直接生成 15 秒广告的过程。关键的 prompt 结构是:

@ai_for_success 单图产品广告成片截帧:水下智能手表

成片截帧:单图生成的商用级产品镜头——珊瑚、海龟与手表同框,表盘文字清晰。

``` 产品图作为主视觉参考。

镜头从产品正面开始,缓慢环绕拍摄,展示产品细节。 背景为浅灰色渐变,光线柔和,营造高级质感。 第 8 秒镜头推近到产品 LOGO 特写。 第 12 秒拉远,展示产品全貌,背景出现品牌标语。 整体风格:简洁、高级、商业广告质感。 ```

同样,创作者 @thisismariaa25 用菜单概念图生成了一段夏日竖屏餐饮视频,适合本地生活和电商场景。

@thisismariaa25 夏日菜单竖屏成片截帧

关键要点:

  • 产品图的构图和光线质量直接决定输出质量
  • 在 prompt 中指定镜头运动(环绕、推近、拉远)
  • 明确背景风格和整体氛围(「简洁」「高级」「商业广告质感」)
  • 竖屏内容加 9:16 或「竖屏」指令

> 原帖: > > - @ai_for_success — 单图产品广告 > - @thisismariaa25 — 夏日菜单竖屏


技巧六:风格融合的 Prompt 结构——打破单一风格的局限

核心思路: 用两到三个风格关键词的组合,创造出独一无二的视觉语言。

H3 的风格理解能力很强,你可以把看似不搭的风格拼在一起,产生惊喜。

实战案例一:时尚 editorial × 地下说唱 MV

创作者 @Strength04_X 把三种视觉语言融合在一起:

@Strength04_X 时尚 editorial × cyber-grunge MV 成片截帧

`` 时尚 editorial 质感 + cyber-grunge 字体 + 地下说唱 MV 剪辑节奏。 画面在高端时装秀场和地下停车场之间切换。 字体风格:粗体无衬线,带霓虹光晕。 色调:高对比,暗部偏青,亮部偏橙。 ``

实战案例二:实拍照片 × 插画融合

创作者 @aichof21 用一张实拍 snap 照片作为参考,让 H3 生成了「照片逐渐融化为插画」的动态效果:

@aichof21 实拍×插画融合成片截帧

`` 参考图为实拍照片。 画面从写实照片开始,逐渐过渡为手绘插画风格。 过渡过程中保持构图不变,只改变画面的笔触和色彩。 最终画面为水彩插画风格,保留照片的光影关系。 ``

实战案例三:二次元原创短片

创作者 @hafuma 制作了一段二次元角色驱动的短片。他的风格指令非常明确:

@hafuma 二次元原创短片成片截帧

`` 日式动画风格,赛璐珞着色,线条清晰。 角色表情丰富,动作流畅。 背景为新海诚式光影,天空有丁达尔效应。 ``

关键要点:

  • 风格融合不是「随便混」,而是用 2-3 个明确的风格标签组合
  • 在 prompt 中指定色调(「暗部偏青」「亮部偏橙」)比说「好看」有用 100 倍
  • 参考知名创作者/作品的风格名称(「新海诚式」「赛璐珞着色」)能大幅提升准确度

> 原帖: > > - @Strength04_X — 时尚×说唱 MV > - @aichof21 — 实拍×插画融合 > - @hafuma — 二次元原创短片


技巧七:分镜时间码——让 AI 按你的剪辑节奏走

核心思路: 把 15 秒的视频拆成 3-5 个时间段,每个时间段写一个分镜描述。

这是所有技巧中最「导演思维」的一个。当你把时间码写进 prompt,AI 就不再是在「猜」你想要什么,而是在「执行」你的分镜表。

实战案例一:喷气机编队航拍

创作者 @Kuriyama890 制作了一段三机编队航拍视频,镜头切换非常流畅。他的 prompt 结构:

@Kuriyama890 喷气机编队 + 云字成片截帧

成片截帧:三机编队拉出尾迹,天空中的云字写着 “is coming”——分镜时间码 + 文字渲染同时生效。

`` [0s-3s] 广角航拍,三架战斗机以 V 字编队飞过雪山。 [3s-7s] 切换到座舱特写,飞行员戴上头盔。 [7s-11s] 编队拉升,喷出白色尾迹。 [11s-15s] 仰角镜头,三架飞机在天空中拉出「H3」字样。 ``

实战案例二:故事预告片向商业成片

创作者 @john_my07 强调了 H3 在 prompt following、文字渲染和运镜控制上的综合能力,他的做法是把预告片的经典结构写进 prompt:

@john_my07 故事预告片成片截帧

`` [0s-4s] 黑屏,白色字幕淡入片名。 [4s-8s] 快速闪切 3 个场景镜头,每个约 1.3 秒。 [8s-12s] 主角正面特写,缓慢推近。 [12s-15s] 黑屏,出现上映日期文字。 ``

关键要点:

  • 每个时间段 3-5 秒,不要太短(AI 来不及完成动作)也不要太长(节奏拖沓)
  • 每个时间段只描述一个核心动作或镜头变化
  • 开头和结尾可以加「黑屏渐入」「淡出黑屏」来增加电影感
  • 时间码的写法:[0s-3s][3s-7s][7s-15s],注意不要有间隙

> 原帖: > > - @Kuriyama890 — 喷气机编队航拍 > - @john_my07 — 故事预告片


更多值得学习的案例

除了上面 7 个核心技巧对应的案例,还有几个值得关注的实践:

电影感多镜头试片 — @maxescu

约 280 赞,展示了 H3 的 cinematic 上限。原帖还附带了多段极详细的分镜 prompt(时间轴、镜头、物理、灯光、对白全部写死),非常值得精读。

@maxescu 电影感试片成片截帧

日文规格科普 + 成片 — @seiiiiiiiiiiru

日语社区的标杆案例,兼具产品规格说明与成片演示。

@seiiiiiiiiiiru 日文规格科普成片截帧

PixVerse 平台合作 Demo — @PixVerse_

产品宣发级成片,适合对照平台官方 demo 的风格上限。

@PixVerse_ 平台 Demo 成片截帧
案例创作者亮点原帖
电影感多镜头试片@maxescu高赞 cinematic 上限 + 超长分镜 prompt链接
日文规格科普+成片@seiiiiiiiiiiru日语社区标杆链接
竖屏角色对口型@qaHEqxyzUF99214对口型(lip-sync)尝试链接
PixVerse 平台合作 Demo@PixVerse_产品宣发级成片链接
纯文生 2K 15 秒测试@MrDavids1T2V 入门体验链接
MV 制作向实验@apilpirman用 H3 做 MV 的探索链接

总结:H3 Prompt 的黄金公式

把上面 7 个技巧浓缩成一个公式:

`` [时间轴] + [镜头运动] + [画面内容] + [风格/色调] + [参考图/视频/音频说明] ``

一个完整的 prompt 示例:

``` 参考图 1 为角色 A(女性,黑色短发,白色衬衫)。 参考图 2 为办公室环境(落地窗,城市天际线)。 参考视频用于提取运镜节奏。

[0s-4s] 中景,角色 A 坐在办公桌前,低头看电脑,自然光从落地窗洒入。 [4s-8s] 角色抬头,表情惊讶,镜头缓慢推近到面部特写。 [8s-12s] 角色站起身,走向落地窗,镜头跟随。 [12s-15s] 角色背影站在窗前,城市天际线在窗外展开,画面定格。

整体风格:电影感,色调偏冷,浅景深,自然光线。 ```

最后的建议:

  1. 先写分镜,再填细节。 把 15 秒拆成 3-5 个时间段,先确定每个时间段的核心动作。
  2. 参考图要分工。 人物一张、环境一张、风格参考一张,不要混在一起。
  3. 风格指令要具体。 说「赛璐珞着色,新海诚式光影」比说「动漫风格」有用得多。
  4. 多模态输入不是越多越好。 每个输入都要有明确的角色(画面/节奏/氛围),否则会互相干扰。
  5. 善用文字渲染能力。 如果你的视频需要标题、字幕或 UI 文字,H3 是目前最好的选择之一。

相关文章