2026年7月31日,中国AI公司 MiniMax 正式发布了 MiniMax H3——这是其 Hailuo 视频家族的第三代模型,也被称为 Hailuo 3.0。两周前在 WAIC 2026 上首次预览的 H3 带来了明确的野心:不仅仅是生成运动的图像,而是制作完整的短视频视听场景——支持原生 2K 分辨率、同步音频,以及单次生成最长 15 秒的连续画面。
如果你一直在关注 AI 视频领域,就知道进步的速度有多快。每隔几个月就会有新模型出现,每个都声称在突破边界。那么 H3 究竟带来了什么,值得关注吗?以下是你需要知道的一切。
一句话概括 MiniMax H3
MiniMax H3 是一款多模态AI视频生成模型(multimodal AI video-generation model),能够以 24fps 的帧率(frame rate)生成原生 2K 视频,并内置同步音频——包括对话、音效和环境氛围——支持从文本提示、图像或包括视频和音频片段在内的多种参考材料组合生成。
这是一款视频模型,而非文本或编码模型。MiniMax 还在同一场 WAIC 2026 活动上发布了 M3 语言模型(用于文本、智能体和推理),两者在网上经常被混淆。H3 专注于视频创作。
核心参数一览
在深入了解 H3 的亮点之前,先看看技术参数:
| 参数 | 详情 |
|---|---|
| 分辨率 | 原生 2K(2560×1440) |
| 帧率 | 24fps(电影标准) |
| 时长 | 每次生成 5-15 秒(使用延展工具可延长至约 30 秒) |
| 音频 | 原生立体声——对话、音效和环境音一次生成 |
| 宽高比 | 21:9、16:9、4:3、1:1、3:4、9:16(六种选项) |
| 输入模式 | 文本生成视频、图像生成视频(首帧/末帧)、全向参考生成视频 |
| 参考限制 | 最多 9 张图像 + 3 个视频片段 + 3 个音频片段(每个请求最多 12 个文件) |
| 编辑功能 | 基于指令的编辑(instruction-based editing),可对已生成内容进行修改 |
| 定价 | 2K 分辨率约 $0.13/秒(5 秒片段约 $0.65;15 秒片段约 $1.95) |
这些数字很重要,但只能说明部分问题。真正的问题是 MiniMax H3 能用它们做什么。
定义 H3 的三大特性
1. 全向参考(Omni-Reference)——锁定跨镜头的角色一致性
AI 视频中最持久的痛点之一是角色一致性。在一个镜头中生成一个走过咖啡馆的女性,她在下一个镜头中可能看起来完全是另一个人。面部会漂移,服装会改变,声音会变化。
H3 通过 MiniMax 所称的 Omni-Reference 来解决这个问题——这是一个控制系统,允许你将最多 9 张参考图像、3 个视频片段和 3 个音频片段输入单个生成请求。模型将所有这些输入作为一个统一的上下文来读取,从照片中提取角色的面部,从视频片段中借鉴镜头运动,并从音频样本中吸收音色。
实际效果:一个角色可以在同一次 15 秒的生成中出现在远景、特写和侧面视角中——并且看起来、动起来和听起来都是同一个人。对于制作系列内容、短片或使用固定演员的品牌活动的创作者来说,这是一个有意义的进步。
充分利用 Omni-Reference 的一些技巧:
- 使用光线均匀、正面角度、无遮挡(帽子、太阳镜、头发遮脸)的参考图像。
- 将图像参考与清晰的音频片段配对,以同时固定外观和声音。
- 在系列内容的多次生成中重复使用相同的参考集以保持一致性。
2. 原生音频(Native Audio)——从无声片段到可编辑的初剪
迄今为止,大多数 AI 视频模型都生成无声输出。你得到视觉效果,然后在单独的步骤中添加声音——配音对话、叠加音效、寻找合适的背景音乐。这种工作流程可行,但会使每个短片的制作时间翻倍。
H3 在单次生成中同时生成音频和视频。对话会落在嘴部动作上,玻璃破碎时会发出碎裂声,角色说话时雨滴会打在窗户上。时序在生成过程中确定,而不是事后对齐。
这改变了输出的本质。一个无声的 AI 视频是一个视觉资产——有用,但不完整。一个带有可用声音的视频更接近可编辑的初剪。对于短视频广告、社交内容和叙事场景来说,这种差异意义重大。
不过,"原生音频"并不自动意味着"完美音频"。对话的准确性、口型同步的质量、声音的情感表达——所有这些仍需在实践中测试。早期用户报告了总体不错的结果,但与任何生成音频一样,边缘情况和复杂场景可能会产生伪影。建议:将生成的音频视为良好的起点,而不一定是最终交付物。
3. 基于指令的编辑——无需重新生成即可优化
这个功能听起来可能不那么炫酷,但最终可能成为 H3 最实用的优势之一。
想象一下,你生成了一个 15 秒的片段,90% 都是对的。构图很好,光线合适,角色的表演很自然——但夹克颜色不对,或者背景需要改变。使用大多数视频模型,你唯一的选项是调整提示词并从头重新生成,希望新版本能保留你喜欢的原始内容。
H3 允许你用自然语言描述更改并将其应用到现有的生成结果上。"把夹克改成红色"、"把背景换成日落时的海滩"、"加快后半部分的节奏"。模型只修改指定的元素,同时保留其他一切——构图、光线、表演、摄像机路径。
对于迭代式创意工作来说,这是一个真正的工作流程升级。它将过程从"生成并祈祷"转变为"生成并优化",而这正是专业创意制作的实际运作方式。
H3 与前代产品相比如何?
如果你使用过前代产品 Hailuo 2.3,升级到 H3 的提升是巨大的。以下是并排对比:
| 维度 | Hailuo 2.3 | MiniMax H3 |
|---|---|---|
| 分辨率 | 768p / 1080p | 原生 2K |
| 最长时长 | 约 10 秒 | 15 秒(可延长至约 30 秒) |
| 参考输入 | 仅图像 | 图像 + 视频 + 音频 |
| 原生音频 | 否 | 是——立体声,一次生成 |
| 指令编辑 | 否 | 是 |
| 定价模式 | 按次计费 | 按输出秒数计费 |
| 宽高比 | 有限 | 六种选项(21:9 到 9:16) |
分辨率从 1080p 跳到原生 2K 不仅仅是规格表上的一个数字。这里的"原生"意味着模型在内部以完整的 2K 像素密度渲染——清晰的细节是在生成过程中直接产生的,而不是通过单独的放大步骤生成的。对于面向大屏幕、零售显示器或高分辨率客户交付物的内容来说,这种区别很重要。
时长的增加在实践中同样重要。十秒可以覆盖一个瞬间或一个开场钩子。十五秒——在一次生成中可能包含多个镜头——可以容纳开场、关键动作、反应和视觉结论。这就是片段和场景之间的区别。
如何访问 H3 及其费用
H3 可通过多种渠道访问,具体取决于你的需求:
Hailuo 官方网站(hailuoai.video)
个人创作者最简单的入口。注册,选择 H3,通过网页界面开始生成。无需 API 集成。
EvoLink 统一 API
适合希望将 H3 集成到产品或工作流程中的开发者。EvoLink 根据输入类型提供三个模型 ID:
minimax-h3-text-to-video——从文本提示生成minimax-h3-image-to-video——从首帧/末帧图像生成minimax-h3-reference-to-video——从多模态参考生成
该 API 是异步的:你提交任务,轮询状态,然后下载生成的 MP4 文件。没有取消端点——如果任务失败,你会获得全额退款。
第三方平台
OpenArt、Atlas Cloud 和其他推理提供商也通过自己的界面提供 H3 访问,通常具有统一的 API 兼容性和按需付费定价。
定价明细
- 标准费率:2K 分辨率约 $0.13/输出秒
- 5 秒 2K 片段约 $0.65
- 15 秒 2K 片段约 $1.95
- 参考图像和音频不会增加计费时长;参考视频片段会增加
- Hailuo 平台上的一些早期测试用户报告在基础订阅层级上 15 秒 2K 片段约 $1——尽管这尚未得到官方确认
与竞争对手相比:据报道,Seedance 2.0 在 Dreamina 基础层级上 15 秒 1080p 片段约 $4。如果这些数字准确,H3 以四分之一的价格提供约 4 倍的分辨率——这是一个极具吸引力的每像素成本优势。
MiniMax 是谁?
对于不太熟悉该模型背后公司的人:MiniMax 是一家总部位于上海的 AI 实验室,也是中国最知名的 AI 公司之一。公司于 2026 年 1 月完成香港 IPO,据报道以约 40 亿美元的估值筹集了约 6.19 亿美元。其支持者包括阿里巴巴和腾讯。
MiniMax 的消费级视频品牌是 Hailuo,该品牌在 AI 视频社区中以强大的物理模拟、快速的生成速度和易于接受的定价建立了声誉。H3 是 Hailuo 家族的第三代产品,继 Hailuo 02 和 Hailuo 2.3 之后推出。
值得注意的是,H3 是一个平台模型,而非开放权重发布。与 MiniMax 的 M3 语言模型(有开放权重变体)不同,H3 仅通过 API 和 Hailuo 平台访问。目前没有迹象表明这种情况会改变。
H3 在 2026 年 AI 视频格局中的位置
2026 年中期的视频模型格局竞争激烈。以下是简要定位图:
| 模型 | 开发者 | 突出优势 |
|---|---|---|
| MiniMax H3 | MiniMax | 全向参考控制、原生音频、指令编辑、定价优势 |
| Kling 3.0 Pro | Kuaishou | 原生 4K、强大的运动和物理效果 |
| Veo 3.1 | Google DeepMind | 48kHz 高保真对话 |
| Seedance 2.0 | ByteDance | 多模态参考、音频集成 |
| Wan 2.7 | Alibaba | 唇形同步、文本/图像/视频/音频输入 |
| Runway Gen-4.5 | Runway | 成熟的创意工具生态系统 |
H3 的卖点不是"最高的原始保真度"——Kling 3.0 和 Veo 3.1 都在推动原生 4K。相反,H3 在控制(Omni-Reference)、完整性(一次生成原生音频)、迭代速度(基于指令的编辑)和价格的组合上竞争。对于许多实际用例——社交广告、产品视频、短篇叙事内容——这种组合可能比单纯的原始分辨率更重要。
关于竞争格局的一个重要说明:OpenAI 于 2026 年 4 月停止了其 Sora 网页和应用体验,API 计划于 2026 年 9 月退役。Sora 不再是新视频工作流程的可行选项。
常见问题
MiniMax H3 和 Hailuo H3 是同一个东西吗?
是的。"MiniMax H3"是企业品牌;"Hailuo H3"是产品品牌。它们指的是同一个模型。在某些情况下,"Hailuo 03"和"Hailuo 3"也会互换使用。
H3 支持 4K 输出吗?
不支持。最大输出分辨率是原生 2K(2560×1440)。如果你需要 4K,Kling 3.0 Pro 或 Veo 3.1(8 秒片段)是目前的选择。
H3 视频能有多长?
单次生成支持 5 到 15 秒。使用延展视频工具,片段可以延长到大约 30 秒。
H3 是开源或开放权重的吗?
不是。H3 通过 API 和 Hailuo 平台访问。它不作为可用于本地部署的开放权重模型提供。
每个 H3 视频都带有音频吗?
是的。每次生成都包含原生立体声音频——对话、音效和环境氛围——与视频在同一过程中生成。
我可以将 H3 用于商业内容吗?
请查看 MiniMax 当前的服务条款以获取有关商业使用权的最新信息。该平台在设计时考虑了专业和商业用例,但具体的许可条款可能有所不同。
H3 现在可用吗?
是的。H3 于 2026 年 7 月 31 日正式发布,可通过 Hailuo 平台、EvoLink API 和部分第三方提供商访问。
H3 如何处理失败的任务?
失败、过期和被拒绝的任务将获得全额退款。没有取消端点——一旦提交,任务将运行至完成或失败。
总结
MiniMax H3 不仅仅是对前代产品的渐进式升级。它代表了 AI 视频模型目标的转变:不是孤立的运动图像,而是完整的短视频视听场景,内置画面、声音和编辑控制。
原生 2K 分辨率使其处于与大多数 1080p 竞争对手不同的质量层级。Omni-Reference 系统提供了异常慷慨的角色和风格一致性控制。原生音频生成消除了许多短视频工作流程中的单独后期制作步骤。而基于指令的编辑能力将迭代模式从"重新生成并祈祷"转变为"描述并优化"。
它不是适合所有工作的工具。如果你需要 4K 输出、超过 15 秒的镜头、开放权重部署或 48kHz 广播级对话,其他模型目前能更好地满足这些需求。但对于不断增长的大多数 AI 视频用例——社交广告、产品展示、短篇叙事、音乐视频、创意预可视化——H3 提供了质量、控制和成本的引人注目的组合,在 2026 年中期不容忽视。
最好的评判方式是自己测试。写一个你关心的提示词,生成几个变体,并根据你自己的标准评估输出。规格表和评测可以为你指明方向,但没有什么能替代亲眼看到结果。如果你想更深入地了解 H3 的能力、案例和最新动态,也可以访问 minimaxh3.art。
参考资料
- OpenArt: <https://openart.ai/ai-model/minimax-h3/>
- 科创板日报: <https://www.cls.cn/detail/2442143>
- DeeVid Review: <https://deevid.ai/blog/minimax-h3-review>
- OrcaRouter Explained: <https://www.orcarouter.ai/blog/minimax-h3-hailuo-3-explained>
- Kie.ai Guide: <https://kie.ai/blog/what-is-hailuo-h3>
- EvoLink: <https://evolink.ai/zh/hailuo-3>
- Atlas Cloud: <https://www.atlascloud.ai/zh/models/minimax-h3>



