MiniMax H3 现已上线。你可能已经看过了规格参数、刷完了各种演示视频,现在迫不及待想亲自试试。这篇指南将带你走完全流程——从选择平台,到撰写第一个提示词(Prompt),再到迭代优化——让你能以最高效的方式,从零起步生成一段带同步音频的 2K 视频。
本文不假设你有任何 AI 视频生成的使用经验。如果你之前用过其他模型,可以直接跳到最相关的章节;H3 拥有不少独特功能(Omni-Reference、指令式编辑等),即使是老用户也能在这里发现新大陆。
第一步:选择你的入口
H3 有多种访问渠道。选哪一个取决于你想要一个可视化界面来快速测试,还是需要一个 API 来集成到生产工作流中。
方案 A:Hailuo 官网(hailuoai.video)
这是最简单的路径。在 hailuoai.video 注册账号,从模型菜单中选择 H3,然后在浏览器界面中直接开始生成。无需编程,无需管理 API 密钥。
适用人群:个人创作者、初次体验者、以及想先评估 H3 输出质量再决定是否接入 API 的用户。此外,你也可以在 minimaxh3.art 上找到精选案例、使用技巧和 H3 的最新动态。
方案 B:EvoLink 统一 API
对于正在构建产品或自动化工作流的开发者,EvoLink 提供了编程接口,并根据输入类型提供三个模型 ID:
| 模型 ID | 使用场景 |
|---|---|
minimax-h3-text-to-video | 仅使用文本提示词生成 |
minimax-h3-image-to-video | 你有首帧、尾帧或两者,用于锚定生成内容 |
minimax-h3-reference-to-video | 你想提供多模态参考素材(图片 + 视频 + 音频)以获得最大控制力 |
该 API 是异步的:你提交任务后获得一个任务 ID,然后轮询状态,任务完成后下载生成的 MP4 文件。目前没有取消端点——如果任务失败,你会获得全额退款。
一个基本请求如下所示:
``json { "model": "minimax-h3-text-to-video", "prompt": "A lone traveler walks along a windswept cliff at golden hour, cinematic tracking shot", "duration": 5, "quality": "2k", "aspect_ratio": "16:9" } ``
定价:2K 画质下约每输出秒 $0.13。一个 5 秒片段约 $0.65;15 秒片段约 $1.95。参考图片和音频免费;参考视频片段的时长会加入计费时间。
方案 C:第三方平台
OpenArt、Atlas Cloud 等推理服务商通过各自的界面提供 H3 访问,通常具备统一 API 兼容性和按量付费的定价模式。如果你已经在这些平台上有账号,并想在同一环境中将 MiniMax H3 与其他模型进行对比,这些平台会很方便。
第二步:撰写高质量提示词
提示词是你提供的最重要输入。H3 会严格按照你的指令执行——这意味着模糊的提示词产生模糊的结果,而精确的提示词产生精确的结果。一个平庸生成和一个出色生成之间的差距,往往就是提示词的质量。
推荐的提示词结构
把你的提示词想象成一份紧凑的制作简报。最有效的提示词遵循以下顺序:
主体 → 场景 → 动作 → 镜头 → 节奏 → 视觉风格 → 音频
你不需要在每个提示词中包含所有元素。但覆盖主要元素能给模型足够的信息来发挥,而顺序有助于模型理解什么是最重要的。
示例 1:产品广告
`` A luxury silver watch rests on a dark stone pedestal inside a modern gallery. The camera slowly pushes forward as a beam of light moves across the metal surface. Fine dust floats in the air. Premium cinematic commercial style, controlled movement, high contrast lighting, subtle mechanical ticking and deep ambient sound. ``
注意这个提示词如何覆盖了全部七个要素:
- 主体: 豪华银色手表
- 场景: 深色石质基座、现代画廊
- 动作: 光束扫过金属表面
- 镜头: 缓慢推进
- 视觉风格: 高端电影感商业风格、高对比度
- 音频: 机械滴答声、深沉的环境音
示例 2:叙事场景
`` A young woman enters a quiet cafe during heavy rain. She closes her umbrella, looks toward the counter and notices an old friend. Begin with a wide exterior shot, cut to a medium tracking shot as she enters, then finish on a close-up of her surprised expression. Natural dialogue ambience, rain against the windows and soft piano music. ``
这个提示词展示了多节拍叙事:它描述了跨越时间的一系列事件,指定了三个不同的镜头并附带明确的镜头运动方向,同时定义了环境音和音乐两个音频层次。
示例 3:动作场景
`` First-person POV, eye level, handheld game footage. A player holding an assault rifle advances slowly along the perimeter of a modern military base. The crosshair scans the corridor ahead; after a brief pause, the player fires several rounds at a distant target point, then continues forward. Cold natural lighting mixed with smoke and muzzle flash. Subtle handheld sway with small lateral glances, minor recoil vibration when firing, then steady forward movement. ``
这个演示展示了如何为高强度内容指定视角(第一人称 POV)、物理行为(后坐力、晃动)和氛围(冷光、烟雾、枪口闪光)。
真正有用的提示词规则
根据早期用户测试和平台文档,以下准则对生成质量的影响最为显著:
- 用专业镜头语言描述摄影机运动。 "Slow orbit to the right"(缓慢向右环绕)比 "camera moves around"(镜头围着转)效果好。"Handheld tracking shot"(手持跟拍)比 "following the character"(跟着角色走)效果好。H3 遵循电影术语——请使用它们。
- 按时间顺序描述事件。 模型会将你的提示词理解为一条时间线。如果你在描述开头之前先描述了结尾,模型可能会重新排列镜头顺序。
- 限制主要动作的数量。 一个 15 秒的片段最多支持 2-3 个不同动作或叙事节拍。试图在 15 秒内塞进六个事件只会产生混乱的输出。
- 将视觉指令与音频指令分开。 先写视觉描述,再在末尾添加音频提示。这有助于模型区分哪些指令对应哪个输出通道。
- 明确标注必须保持一致的内容。 如果一个角色的外观、产品的品牌标识或某个背景元素需要在镜头间保持稳定,请在提示词中明确说明。
- 不要每秒都填满新事件。 H3 能很好地处理节奏和停顿。留出"静止时刻"的空间,比按秒列出动作清单能产生更自然的结果。
第三步:使用 Omni-Reference 实现最大控制力
Omni-Reference 是 H3 的标志性功能,也是该模型与其他竞品拉开差距的关键所在。以下是如何高效使用它的方法。
可上传的素材类型
| 参考类型 | 数量上限 | 时长限制 | 文件大小 |
|---|---|---|---|
| 图片 | 最多 9 张 | — | 每张 30 MB |
| 视频片段 | 最多 3 段 | 每段 2–15 秒;同类型总计 15 秒 | 每段 50 MB |
| 音频片段 | 最多 3 段 | 每段 2–15 秒;同类型总计 15 秒 | 每段 15 MB |
| 文件总数 | 12 个 | — | 请求体上限 64 MB |
关键限制:
- 音频不能单独提交——必须至少搭配一张图片或一段视频。
- 参考视频的时长会加入计费输出时间;参考图片和音频不会。
- 支持格式:JPG、PNG、WEBP、HEIC、HEIF(图片);H.264、H.265(视频);WAV、MP3(音频)。
如何准备参考图片
参考图片的质量直接决定了角色一致性(Character Consistency)的效果。请遵循以下准则:
- 均匀光照。 避免强烈阴影、强逆光或混合色温。光线充足、阴影最小的正面面部能给模型提供最有用的数据。
- 正面角度。 正面或接近正面的照片效果最佳。侧面、四分之三角度和歪头照片会降低模型锁定身份的能力。
- 无遮挡物。 帽子、墨镜、遮脸的头发、手挡脸——这些都会降低参考效果。
- 干净的背景。 简洁、不杂乱的背景有助于模型将主体从环境中分离出来。
- 尽可能提供多角度。 如果你有多个参考槽位,请善加利用:一张正面、一张微侧面、一张全身。这样能给模型更完整的画面。
如何准备音频参考
音频参考用于锚定角色的嗓音。同样的质量原则适用:
- 使用背景噪音最小的干净录音。
- 2–15 秒的清晰语音即可。
- 音色一致(不要在片段内出现从低语到喊叫的突变)。
- 如果你需要特定的口音或说话模式,参考素材应该能体现出来。
何时使用 Omni-Reference vs. 文生视频(Text-to-Video)
| 场景 | 推荐模式 |
|---|---|
| 快速概念测试,无特定角色需求 | Text-to-video |
| 从产品照片生成产品动画 | Image-to-video(首帧) |
| 角色在外貌和声音上需要跨镜头一致 | Omni-reference |
| 从已有素材做风格迁移 | Omni-reference(视频片段) |
| 带品牌吉祥物的广告创意 | Omni-reference(图片 + 音频) |
| 有固定表演者的音乐视频 | Omni-reference(图片 + 视频 + 音频) |
第四步:生成、审阅与迭代
生成前的设置
在点击生成之前,请先配置以下参数:
- 时长: 测试阶段先用 5 秒。确认提示词和参考素材效果满意后,再延长到 10 或 15 秒。
- 宽高比(Aspect Ratio): 匹配你的目标平台。TikTok/Reels/Shorts 用 9:16。YouTube 和通用场景用 16:9。Instagram 信息流用 1:1。电影宽银幕用 21:9。
- 画质: 2K 是上线时的唯一选项——这也是默认值和推荐设置。
第一次生成该评估什么
不要只看一遍输出就完事了。请系统性地评估以下维度:
- 提示词遵循度。 模型是否按照你的主体、场景、动作和镜头指令执行了?如果没有,哪些元素被忽略或误解了?
- 角色一致性。 (使用参考素材时)角色是否与参考图片吻合?面部特征、服装和比例在镜头间是否稳定?
- 音频质量。 对白是否清晰可辨?音效是否在正确的时刻触发?环境氛围是否恰当?
- 运动质量。 动作是否自然?是否存在变形、闪烁或时间上的不一致?
- 整体构图。 取景是否合适?光照是否一致?节奏感是否恰当?
使用指令式编辑(Instruction-Based Editing)进行迭代
这正是 H3 工作流优势凸显的地方。当你的生成结果已达到 85%-90% 的满意度,只有某个元素需要修正时,不要从头重新生成。请使用指令式编辑。
发送一条后续指令,只描述你想更改的部分:
- "Change the jacket color to navy blue."
- "Replace the background with a sunset beach."
- "Make the camera movement slower in the first half."
- "Change the character's expression to more surprised."
模型会将编辑应用到现有生成上,同时保留取景、光照、表演和摄影机路径。这比重新生成高效得多——保留好的部分,修复不好的部分。
小技巧: 如果你的第一条编辑指令没有达到预期效果,试着用更具体的措辞重新表述。"Change the background"(更改背景)太模糊。"Replace the background with a white studio wall with soft directional lighting from the upper left"(将背景替换为白色影室墙,左上方有柔和定向光)则足够具体,模型可以据此执行。
何时该重新生成而不是编辑
指令式编辑功能强大,但并非总是最佳选择:
- 根本性错误的输出(主体完全不对、场景彻底错误、动作不连贯):用修改后的提示词重新生成。
- 多个相互关联的问题(修复一个需要连锁改动):重新生成可能比叠加多条编辑指令更干净。
- 想要全新的创意方向:有时候最好的做法是换一个完全不同的提示词,而不是在一个方向错误的生成上强行编辑。
第五步:导出与集成
下载你的视频
生成的视频以 MP4 文件形式交付。在 Hailuo 网页界面中,生成完成后点击下载按钮即可。通过 API 调用时,已完成的任务响应中会包含一个下载链接。
重要提醒: 视频链接在生成 24 小时后过期。请尽快下载并保存文件。如果你正在构建自动化流水线,请在任务完成后立即将 MP4 拉取并存储到你自己的存储系统中。
后期制作集成
在大多数使用场景中,生成的视频在最终交付前还需要一些后期处理:
- 品牌元素。 在你的视频编辑器中添加 Logo、水印和品牌专属的文字叠层。H3 能很好地处理视觉场景,但精确的排版和 Logo 放置在后期制作中完成更稳妥。
- 调色。 如果你的品牌有特定的色彩体系或视觉风格,请在后期中进行调色,使生成视频与你的视觉形象保持一致。
- 音频混音。 虽然 H3 会生成同步音频,但你可能还需要调整音量电平、添加背景音乐,或用专业配音替换对白后再最终交付。
- 平台格式化。 按照目标平台要求的编码器、码率和容器格式导出(大多数社交平台用 H.264 MP4,广播级用 ProRes 等)。
现在就能用的提示词模板
复制、定制、生成。这些模板经过专门设计,以在 H3 上获得最佳效果。
模板 A:电影感产品镜头
`` A [product] rests on [surface] inside [environment]. The camera [movement description] as [lighting effect]. [Atmospheric detail]. [Visual style] commercial aesthetic, [lighting quality]. [Audio: ambient sound + subtle effect]. ``
示例: `` A matte black perfume bottle rests on a white marble slab inside a dimly lit studio. The camera slowly orbits to the right as a single spotlight sweeps across the glass surface. Fine mist particles float in the air. Minimalist luxury commercial aesthetic, dramatic directional lighting. Soft ambient hum and gentle glass resonance. ``
模板 B:角色驱动的叙事片段
`` [Character description] [action sequence in chronological order]. Begin with [opening shot], [transition shot], then finish on [closing shot]. [Dialogue or vocal quality]. [Ambient sounds] + [background music]. ``
示例: `` A middle-aged man in a worn leather jacket sits alone at a rain-streaked window in a dimly lit diner. He stares at an old photograph, then slowly folds it and puts it in his pocket. Begin with a wide shot of the empty diner, cut to a medium close-up of his hands holding the photo, then finish on a tight close-up of his weathered face. Quiet, gravelly breathing. Rain against glass, distant highway traffic, muted jukebox playing a slow blues track. ``
模板 C:社交媒体吸睛短视频
`` Quick [opening action] reveals [subject] in [setting]. Camera [dynamic movement]. [Second action/beat]. [Third action/beat with visual payoff]. [Style] aesthetic, [vibrant/moody/energetic] mood. [Punchy audio: beat drop / sound effect / music style]. ``
示例: `` Quick hand swipe reveals a pair of glowing neon sneakers floating in a dark warehouse. Camera dollies forward rapidly. The sneakers drop and land on a reflective wet floor, sending sparks outward. Urban streetwear aesthetic, high-energy mood. Heavy bass beat drop on impact, electronic hum, echo reverb. ``
模板 D:预可视化(Pre-Visualization)/ 分镜
`` [Scene description] with [key elements]. Camera: [specific shot instruction]. Lighting: [lighting description]. Mood: [emotional tone]. Style: [reference style]. Pre-viz storyboard shot, cinematic quality. [Audio mood]. ``
示例: `` A crowded Tokyo street at night with neon signs, umbrella-carrying pedestrians, and a wet asphalt road. Camera: handheld following shot behind a young woman walking briskly through the crowd. Lighting: warm neon glow with cold blue reflections on wet ground. Mood: tense, anticipatory. Style: Blade Runner-inspired neo-noir. Pre-viz storyboard shot, cinematic quality. Muffled crowd noise, rain footsteps, distant electronic music. ``
常见错误及规避方法
| 错误 | 原因 | 解决方案 |
|---|---|---|
| 角色在每个镜头中长得不一样 | 未使用参考图片,或参考图片质量低 | 上传干净、光线均匀、正面朝向的参考图片 |
| 音频与画面不匹配 | 视觉和音频指令在提示词中混在一起 | 将视觉描述与音频描述分开;将音频提示放在末尾 |
| 镜头运动感觉随机 | 提示词描述了场景但没有描述镜头 | 始终使用专业镜头语言明确指定摄影机运动 |
| 15 秒内事件太多 | 提示词试图把一个完整故事线塞进一次生成 | 每次生成限制为 2-3 个动作;对于更长的故事使用多次生成 |
| 编辑指令改动过多或过少 | 编辑指令要么太模糊要么太宽泛 | 明确说明什么要改、什么要保留;每条指令只做一个明确的修改 |
| 视频链接在下载前过期 | 忘记了 24 小时过期限制 | 生成后立即下载;在 API 流水线中自动化存储 |
快速参考卡
| 参数 | 可选值 | 推荐 |
|---|---|---|
| 时长 | 5–15 秒 | 测试用 5 秒,正式生产用 15 秒 |
| 宽高比 | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 匹配你的目标平台 |
| 画质 | 2K | 默认值——上线时无其他选项 |
| 参考图片 | 0–9 张 | 使用 2-5 张以获得最佳角色一致性 |
| 参考视频 | 0–3 段 | 使用 1-2 段进行运动/风格迁移 |
| 参考音频 | 0–3 段 | 使用 1 段进行声音锚定(需搭配图片或视频) |
| 提示词长度 | 中文:≤500 字符;英文:≤1000 词 | 简洁但具体 |
参考资料
- OpenArt Tutorial: https://openart.ai/ai-model/minimax-h3/
- EvoLink API Guide: https://evolink.ai/zh/hailuo-3
- DeeVid Prompting Tips: https://deevid.ai/blog/minimax-h3-review
- Atlas Cloud Guide: https://www.atlascloud.ai/zh/models/minimax-h3
- OrcaRouter Explained: https://www.orcarouter.ai/blog/minimax-h3-hailuo-3-explained



