图 1:MiniMax H3 官方发布主视觉。来源:MiniMax 官方博客(minimax.io/blog/minimax-h3)。
一、开篇引言
2026 年 7 月 31 日,MiniMax 稀宇科技正式发布了新一代通用全模态生成模型——MiniMax H3(中文社区常称"海螺 3"或"Hailuo 3.0")。这一天,恰好也是 2026 世界人工智能大会(WAIC)开幕的日子,MiniMax 选择在这个节点发布,意图不言自明:H3 不是又一次渐进式升级,而是要重新定义 AI 视频生成模型的边界。
过去两年,AI 视频生成赛道经历了爆发式增长。从早期只能生成几秒模糊画面的学术原型,到如今能够输出 2K 分辨率、带原生立体声的商业级短视频,技术迭代的速度远超多数人的预期。然而,一个长期困扰行业的问题始终没有被真正解决:不同模态之间的割裂。文生视频、图生视频、视频编辑、音频生成——这些任务往往由不同的模型或管线完成,用户需要在多个工具之间反复切换,素材在流转过程中不断丢失语义信息。最终的成品质量,很大程度上取决于用户"翻译"自己创意的能力,而不是模型理解创意的能力。
H3 的核心野心,正是打破这种割裂。它不是一款单纯的"文生视频"模型,而是一个将文本、图像、视频和音频放入同一上下文中进行统一理解、参考、编辑和再生成的多模态内容制作引擎[1]。你可以同时给它一张人物照片、一段运镜视频、一段人声音频,再加上一段文字描述,让它一次性理解所有素材之间的关系——谁是主角、谁提供动作、谁提供声音、风格往哪个方向走——然后直接输出一段带声音的成品视频。
这种"全能参考"能力,在当前的商业视频模型中并不多见。更关键的是,H3 在定价上也展现出了极大的侵略性:2K 分辨率每秒仅约 0.8 元人民币,不到主流竞品的三分之一 [1][8]。再加上 MiniMax 宣布将在发布后数日内开放模型权重,H3 有潜力成为第一个真正意义上"既好用、又便宜、还能自己部署"的头部视频生成模型 [1]。
当然,任何新模型发布都伴随着兴奋与审慎。截至 2026 年 8 月 1 日,H3 的完整技术报告尚未发布,参数量、训练数据规模、损失函数等关键信息均未披露,开放权重也尚未实际交付。Artificial Analysis 的独立盲测显示 H3 在视频编辑任务中排名第一,但这些 Elo 分数衡量的是用户主观偏好,而非物理准确率或逐帧重建质量 [3]。
本文将从技术架构、核心能力、竞品对比、使用指南、定价成本、开源生态、局限风险等多个维度,对 MiniMax H3 进行全面、深入的梳理与分析。无论你是内容创作者、技术决策者,还是 AI 视频领域的研究者,都能在这篇文章中找到你需要的信息。
> 想边读边上手:可在 minimaxh3.art 直接试用 MiniMax H3(海螺 3)的文生视频与图生视频,生成带音频的 2K 级短片。
二、MiniMax 公司背景
要理解 H3 的战略意义,有必要先了解它的缔造者。
MiniMax 稀宇科技是中国最具代表性的基础模型公司之一,总部位于上海,由前商汤科技副总裁闫俊杰于 2021 年创立。公司专注于大语言模型和多模态生成模型的研发,投资方阵容豪华,包括阿里巴巴和腾讯等巨头 [4]。2026 年 1 月,MiniMax 在香港完成 IPO,融资约 6.19 亿美元,估值约 40 亿美元 [4],成为国内 AI 赛道最受关注的上市公司之一。
MiniMax 旗下的消费级视频产品品牌名为 Hailuo(海螺),以"物理模拟准确、生成速度快、价格亲民"在创作者社区中建立了口碑。Hailuo 系列的迭代路径清晰[4]:
| 版本 | 发布时间 | 核心定位 |
|---|---|---|
| Hailuo 01 | 2024 年 | 从零构建系统,验证视频生成可行性 |
| Hailuo 02 | 2025 年 | 聚焦架构效率、数据质量与规模,原生 1080p |
| Hailuo 2.3 | 2026 年初 | 成熟生产模型,1080p、6–10 秒、改进指令跟随 |
| MiniMax H3 | 2026 年 7 月 31 日 | 通用全模态生成,2K、15 秒、原生立体声 |
从这张时间线可以看出,H3 不是一个突然出现的产品,而是 MiniMax 在视频生成领域持续投入三年后的集大成之作。
!Hailuo to H3 product timeline
图 2:Hailuo 01 → 02 → 2.3 → MiniMax H3 产品演进时间线(示意,英文标注,风格对齐 Hailuo 深色 UI)。
值得注意的是,H3 并非单独发布。在同一次 WAIC 2026 活动上,MiniMax 还发布了 M3 文本大模型——一款面向 Agent 场景的语言模型[4]。H3 负责"看"和"听",M3 负责"想"和"说",两者共同构成了 MiniMax 的多模态智能底座。这种"视觉生成 + 语言推理"的双线布局,暗示了 MiniMax 对未来 AI 应用形态的判断:真正有价值的产品,不会只做文字,也不会只做视频,而是能在不同模态之间自由切换、协同工作的通用智能体。
三、什么是 MiniMax H3
3.1 官方定义
MiniMax H3 的官方定位是通用全模态生成模型。这个定义中的每一个词都值得拆解:
- 通用:不是针对某一类任务优化的专用模型,而是能够处理文生视频、图生视频、视频编辑、音频生成等多种任务的统一架构。
- 全模态:支持文本、图像、视频、音频四种模态的输入理解与输出生成。模型不仅"看懂"图片和视频,还能"听懂"音频,并将这些信息统一编码后指导生成。
- 生成:核心能力是创造新内容,而非仅做分析或分类。
在产品层面,H3 面向用户的主要入口包括:
- Hailuo AI:面向普通创作者的消费级产品,提供网页端和 App。
- MiniMax 开放平台:面向开发者的 API 服务,支持异步任务提交、轮询和回调。
- minimaxh3.art:网页端可直接使用 MiniMax H3 的文生视频、图生视频等能力(含音频,生成与导出)。
此外,H3 已上线多个第三方平台,包括 fal.ai、Atlas Cloud、EvoLink、Topview、Vercel AI Gateway 等,开发者可以通过这些平台直接调用 H3 的能力,无需直接对接 MiniMax 官方 API。
3.2 核心理念:从"任务管线"到"统一上下文"
传统视频生成的工作流通常是这样的:先用一个模型做文生视频,再用另一个模型做风格迁移,再用第三个工具做音频配音,最后在剪辑软件里把所有素材拼起来。每一步都是独立的,每一步都会丢失前一步的语义上下文。
H3 的设计哲学完全不同。它把所有输入——文字描述、参考图片、参考视频、参考音频——全部放入同一个上下文窗口中,由模型统一理解它们之间的关系。官方将这种能力称为 Contextual Omni Representation(全模态上下文表征)。
!Contextual Omni Representation flow
图 3:Contextual Omni Representation 统一上下文流程示意(英文)。
举个具体例子:你可以同时给 H3 三个输入——
- 一张人物照片(图1:主角外貌)
- 一段希区柯克电影的运镜片段(视频1:镜头运动)
- 一段人声歌唱音频(音频3:声音参考)
然后在文字提示中写:"让图1中的人物站在舞台上,使用视频1的运镜方式,跟随音频3唱歌。"
!H3 omni reference character still
图 4:官方全能参考示例中的人物参考图(Image 2)。来源:MiniMax H3 官方博客。
!H3 omni reference generated frame
图 5:同一工作流生成结果截帧(Video 1 运镜 + Image 2 人物 + Audio 3 歌声)。来源:MiniMax H3 官方 demo 视频抽帧。
H3 会自动理解:图1 提供的是人物身份,视频1 提供的是镜头运动风格,音频3 提供的是声音和节奏。它不需要你分别调用三个不同的模型,也不需要你手动指定"这个图片做人物参考、这个视频做动作迁移、这个音频做声音克隆"——模型自己就能从上下文中推断出每个素材的角色。
这种统一理解能力,是 H3 区别于大多数竞品的核心差异点。
3.3 与"文生视频"的本质区别
市面上大多数视频生成模型,本质上是"文生视频"加上一些附加功能(比如图生视频、视频编辑)。它们的核心架构仍然是围绕"从文字描述生成画面"来设计的。
H3 的定位则更接近一个多模态内容制作引擎。文字只是它接受的输入之一,而非唯一驱动力。图片、视频、音频都可以作为等权重的条件输入,模型会根据上下文自动决定每个素材在最终输出中扮演什么角色。
这意味着 H3 更适合这样一类场景:你已经有一些现成的素材(产品照片、品牌视频、广告音乐),想要把它们重新组合成一个新的视频。这在广告、电商、品牌内容制作中极为常见——你不是从零开始创作,而是基于已有的品牌资产进行再创作。
四、核心规格参数
在深入技术架构之前,先用一张表把 H3 的核心参数摆清楚。这些数据来自 MiniMax 官方发布页和 API 文档,截止时间为 2026 年 8 月 1 日。
图 6:H3 输出规格一览(Native 2K / 24fps / 4–15s / Stereo)。示意基于官方 API 规格。
4.1 输出规格
| 参数 | 规格 |
|---|---|
| 最高分辨率 | 原生 2K(短边约 1440 像素,16:9 约 2560×1440) |
| 帧率 | 24fps(电影与广播标准帧率) |
| 输出时长 | 4–15 秒(按整数秒设置),可通过 Extend Video 工具延长至约 30 秒 |
| 宽高比 | 21:9 / 16:9 / 4:3 / 1:1 / 3:4 / 9:16,或自适应 |
| 音频 | 原生双声道立体声(对白 + 音效 + 环境声,与画面同一次推理生成) |
| 输出格式 | MP4 |
几个值得注意的点:
原生 2K,而非后期放大。 H3 的 2K 分辨率是在模型内部以全像素密度渲染的,不是先生成低分辨率画面再通过独立的超分模型放大。官方采用了一种名为 In-Context Regeneration 的技术——模型先生成低分辨率结果,然后重新读取原始多模态上下文进行高分辨率再生成。这意味着小字号文字、Logo 和局部纹理有机会从原始语义中恢复,而不是仅靠超分模型"猜"像素。
24fps 与电影标准一致。 选择 24fps 而非 30fps 或 60fps,说明 H3 的定位偏向影视和广告制作,而非游戏或互动应用。24fps 也是全球院线和流媒体平台的标准帧率,生成的素材可以直接进入后期流程而无需转码。
15 秒上限。 单次生成最长 15 秒,这对于社交广告、产品展示和短叙事已经足够,但无法覆盖长镜头或连续剧情。如果需要更长的视频,可以使用 Extend Video 工具逐段延长,但每段延长都需要一次新的生成任务,角色和风格的跨段一致性需要通过参考素材来维持。
4.2 输入规格
| 参数 | 规格 |
|---|---|
| 文本提示词 | 最长约 7000 字符 |
| 参考图片 | 最多 9 张,单文件 ≤30MB,宽高 256–5760 像素 |
| 参考视频 | 最多 3 段,单段 2–15 秒,单文件 ≤50MB,总时长 ≤15 秒 |
| 参考音频 | 最多 3 段,单段 2–15 秒,单文件 ≤15MB,总时长 ≤15 秒 |
| 混合文件总数 | ≤12 个 |
| 请求体上限 | 64MB |
| 音频限制 | 不能作为唯一条件,必须与文本、图像或视频组合使用 |
这里最值得关注的是 12 个参考文件的上限。9 张图片 + 3 段视频 + 3 段音频,在当前商业视频模型中属于非常慷慨的配置。相比之下,Google Veo 3.1 仅支持 3 张参考图,Kling 3.0 Pro 的参考输入数量也明显少于 H3[4][9]。
但"多"不等于"好"。官方示例和社区实测都表明,一次性塞满 12 个参考文件而不给模型清晰的角色分工,效果往往不如只用 3–5 个高质量参考并在提示词中明确说明每个素材的作用。参考素材的质量和分工,比数量更重要。
4.3 支持的文件格式
| 类型 | 格式 |
|---|---|
| 视频 | H.264、H.265 |
| 图片 | JPEG、PNG、WebP、HEIC/HEIF |
| 音频 | WAV、MP3 |
图片方面,HEIC/HEIF 的支持意味着 iPhone 用户可以直接上传原图,无需先转换格式。视频方面,H.264 和 H.265 覆盖了绝大多数常见编码,但不支持 VP9 或 AV1,使用这些编码的视频需要先转码。
4.4 生成模式
H3 的 API 提供三种生成模式,每种对应一个独立的模型 ID:
| 模式 | 模型 ID | 输入 | 说明 |
|---|---|---|---|
| 文生视频(T2V) | minimax-h3-text-to-video | 纯文本提示词 | 从零生成,适合创意概念和分镜 |
| 图生视频(I2V) | minimax-h3-image-to-video | 提示词 + 1–2 张图片 | 支持首帧、尾帧或首尾帧同时锁定 |
| 参考生视频(R2V) | minimax-h3-reference-to-video | 提示词 + 图片/视频/音频参考 | 全能参考模式,最多 12 个文件 |
图 7:T2V / I2V / R2V 三种生成模式与模型 ID(英文示意)。
此外,H3 还支持指令式编辑:对已生成的视频发送编辑指令,修改特定元素(如替换背景、更换服装颜色、调整动作节奏),其余部分保持不变。这避免了"改一个细节就要重新生成整个视频"的问题,在迭代密集的商业制作中非常实用。
4.5 异步任务机制
H3 的 API 采用异步模式,不是实时推流接口。工作流程为:
- 提交任务:发送生成请求,获得任务 ID。
- 轮询状态:建议每 10 秒查询一次任务状态(排队 → 生成中 → 已完成 / 失败)。
- 下载结果:任务完成后,从返回的 URL 下载 MP4 文件。
也可以通过 callback_url 参数设置 HTTPS 回调,任务完成后由服务器主动通知,无需轮询。
需要注意的是,当前不支持取消已提交的任务,失败和被拒绝的任务会全额退款。
五、四大核心技术架构
官方公开的 H3 技术细节,主要集中在产品技术博客中,并非一篇完整的学术论文。参数量、训练数据规模、损失函数等关键信息均未披露,但已足以勾勒出其设计思路。H3 的技术架构围绕四个核心模块展开。
图 8:H3 四大核心模块总览。示意基于 MiniMax 官方技术说明。
5.1 Contextual Omni Representation(全模态上下文表征)
这是 H3 最核心的设计理念。传统视频生成模型通常将不同任务拆分成独立的子系统——运动迁移、人物参考、风格参考、音频参考各自为政。H3 则采用了一种统一的表征方式:将所有模态的输入信息转化为开放式的语言描述。
具体而言,H3 内部建立了一套专用的理解模型和全模态处理管线。当用户提交一组参考素材(图片、视频、音频)时,模型会进行深度分析:这张图片中的人物是谁、长什么样、穿什么衣服?这段视频的镜头运动是什么风格?这段音频的音色、节奏和情感是什么?这些分析过程大约需要消耗 10 万推理 token[1]。
分析完成后,模型将所有信息压缩为平均约 4000 token 的上下文描述。这份描述不是简单的"这是一个穿红衣服的女人",而是包含了主体身份、动作特征、镜头语言、声音属性、风格偏好等多维度信息的结构化表征。
这种设计的好处是显而易见的:生成阶段的 Transformer 只需要关注这份精炼的上下文描述,而不是直接处理可能长达数十万 token 的原始多模态输入。这大幅降低了推理成本,同时保持了对原始素材语义的充分理解。
5.2 H3-VAE(高压缩率视频编码器)
VAE(变分自编码器)是视频生成模型的标准组件,负责将高维像素空间压缩到低维潜空间。H3 对 VAE 进行了重新设计,官方称之为 H3-VAE。
H3-VAE 的核心改进有两个方面:
重建质量提升。 更好的潜空间可学习性意味着生成阶段的 Transformer 能更轻松地在潜空间中"画画",最终解码回像素空间时失真更小。
高压缩率。 这是 H3-VAE 最关键的特性。官方称其将"有效序列长度"提高到了此前的约四倍[1]。通俗地说,同样一段视频,经过 H3-VAE 编码后的 token 序列长度只有前代模型的四分之一。这意味着在相同的计算预算下,模型可以处理更长的视频或更高分辨率的画面,同时推理速度也更快。
正是 H3-VAE 的高压缩率,使得 H3 在保持原生 2K 输出的同时,仍然能够维持可接受的推理成本和生成速度。没有这个基础,2K 分辨率的实时生成在当前硬件条件下几乎不可能实现。
不过,官方并未披露 H3-VAE 的具体技术细节:空间和时间压缩倍率是多少?是否使用离散 token?潜变量通道数是多少?重建损失和感知损失如何组合?这些问题仍有待完整技术报告的发布。
5.3 H3-Omni Transformer
Transformer 是 H3 的主干网络,负责根据全模态上下文表征和 VAE 编码后的潜变量,生成最终的视频帧序列。
H3-Omni Transformer 的一个关键创新是理解与生成的异构训练架构。由于多模态输入的序列长度方差极大——一个简单的文生视频请求可能只有几百 token,而一个包含 9 张图片、3 段视频和 3 段音频的全能参考请求可能需要数十万 token——这种方差会导致训练效率严重下降:短序列任务早早完成,长序列任务还在跑,GPU 利用率不均衡。
MiniMax 的解决方案是在训练执行层面将"理解"(分析参考素材)和"生成"(合成视频帧)的计算负载分离。这种分离不一定意味着模型由两个独立的神经网络组成,更可能是计算图、并行策略或专家路径上的解耦。官方称这种设计使端到端训练吞吐提升了近 30%[1]。
但需要注意,"训练吞吐提升 30%"是一个工程指标,不是质量指标。它说明 MiniMax 在训练效率上做了优化,但不能直接推断 H3 的生成质量比前代提高了 30%。
5.4 In-Context Regeneration(上下文再生成)
这是 H3 实现原生 2K 输出的关键技术,也是区别于传统超分模型的核心设计。
!In-Context Regeneration vs super-res
图 9:In-Context Regeneration 与传统超分路径对比(英文示意)。
传统的视频超分流程是:先生成低分辨率视频,然后用一个独立的超分模型逐帧放大。超分模型只能从像素层面"猜测"缺失的细节,对于小字号文字、Logo、复杂纹理等语义信息,往往会产生模糊或错误的结果。
H3 的 In-Context Regeneration 采用了完全不同的思路:它让基础模型在生成低分辨率结果后,重新读取原始的多模态上下文(包括文字提示、参考图片、参考视频等),然后基于这些语义信息进行一次高分辨率的再生成。由于模型"知道"原始图片中 Logo 长什么样、文字写的是什么,它有机会在再生成阶段精确恢复这些细节,而不是靠像素插值来猜。
这是一种优雅的设计,但也有代价。再生成阶段可能会引入细节漂移——即高分辨率版本与低分辨率版本在某些细节上不一致。官方尚未公开消融实验来证明 In-Context Regeneration 相对于传统时空超分的收益幅度,实际效果仍需在具体场景中验证。
关于基础生成范式的一点说明。 上述四个模块描述了 H3 的架构组成,但有一个关键信息仍然缺失:H3 的核心生成范式究竟是扩散模型(Diffusion)、流匹配(Flow Matching)、离散自回归还是某种混合机制?官方只提到了 H3-VAE 和 H3-Omni Transformer,没有明确说明底层数学框架。因此,严谨地说,目前只能确认 H3 使用 VAE + Transformer 架构,不能将其直接归类为标准 DiT 或某一种 flow model。这个信息需要等待完整技术报告的发布。
六、能力详解
有了前几章的技术基础,这一章我们具体看 H3 能做什么、做到什么程度、以及它的能力边界在哪里。
6.1 多模态统一理解与生成
这是 H3 最核心的能力,也是前文反复强调的"统一上下文"理念的产品化落地。
在实际使用中,这意味着你可以用一段自然语言告诉 H3 每个参考素材应该扮演什么角色,而不需要通过预设的模板或固定的参数来配置。模型会自动从上下文中推断关系。
官方展示了多个案例。其中一个典型的工作流是:用户上传一张产品图片、一段品牌视频和一段广告音乐,然后用文字描述"让产品以视频中的运镜方式展示,背景音乐使用上传的音频"。H3 在一次生成中完成了产品渲染、运镜模仿和音画同步,无需分步操作。(前文第 3.2 节中的希区柯克运镜案例也是这种能力的经典展示。)
这种能力在广告和品牌内容制作中尤其有价值。品牌方通常已经积累了大量的视觉资产——产品照片、品牌视频、广告音乐、模特图片——H3 可以将这些素材直接作为参考输入,通过文字描述它们之间的关系,快速产出新的视频内容。这比从零开始用纯文字描述要高效得多,也能更好地保持品牌一致性。
6.2 原生音视频同步
H3 的另一个标志性能力是原生双声道立体声音频,与画面在同一次推理中生成。
!Native stereo audio sync schematic
图 10:原生立体声音轨与画面同次推理示意。
图 11:官方 Native Stereo Sound demo 截帧。来源:MiniMax H3 官方博客 demo 视频。
这意味着生成的视频不再是"默片"。对白、环境声、音效和音乐会与画面动作保持时间同步:脚步声跟着步伐节奏,玻璃破碎的音效与画面中的碰撞时刻对齐,角色的口型与说出的台词匹配。对于短视频工作流来说,这省去了单独配音、混音和音画对齐的后期步骤。
音频的能力范围包括:
- 对白生成:角色可以说话,口型与语音对齐
- 音效生成:脚步声、环境声、碰撞声等与画面动作同步
- 音乐生成:背景音乐、氛围旋律
- 声音迁移:上传参考音频后,角色可以以该音色说话或唱歌[9]
但需要理性看待"原生音频"的含义。它是模型在同一次推理中生成音频,而非后期合成,但生成的音频质量、发音准确性、情感表达的细腻程度,与专业配音演员或成熟的语音合成模型(如 MiniMax 自己的 Speech 系列)相比,仍有差距。对于对白要求极高的场景,建议将 H3 的音频视为"初剪级别的参考音轨",而非最终交付物。
6.3 精准可控的编辑与参考
H3 支持多种控制方式,从粗到细排列:
首尾帧控制。 在图生视频模式下,可以同时提供首帧和尾帧图片,模型会在两帧之间生成平滑的过渡动画。这在需要精确控制起止状态的场景中非常有用,比如产品展示的起始角度和结束角度。
指令式编辑(Instruction-Based Editing)。 这是 H3 最具工作流价值的功能之一,也是它在 Artificial Analysis 编辑榜单中排名第一(Elo 约 1130)的核心能力。
指令式编辑的工作方式非常直观:对已生成的视频,用自然语言描述你想要的修改,比如"将背景从室内客厅替换为海边日落沙滩"、"把夹克颜色改为白色"、"添加轻微海浪声"。H3 会只修改指定的部分,尽量保持其他运动、光照和节奏不变。
!Conversational instruction editing
图 12:对话式指令编辑循环示意;编辑 Elo 约 1130(Artificial Analysis,文中引用数据)。
这种交互方式在 Hailuo AI 的产品界面中表现为对话式编辑——你可以像聊天一样,对一个已生成的视频逐条发送修改指令,模型会基于上一次的生成结果进行增量调整。比如先说"把背景换成海边",满意后再说"加上海浪声",再满意后说"把人物服装换成白色连衣裙"。这种迭代方式让创意团队可以像与剪辑师沟通一样与 AI 协作,大大降低了使用门槛。
这避免了传统工作流中"改一个细节就要重新生成整个视频"的痛点。在商业制作中,客户经常会对某个细节提出修改意见——衣服颜色不对、背景换一下、加个字幕——指令式编辑让这类迭代变得快速且低成本。
V2V 动作迁移。 从参考视频中提取动作和运动模式,应用到新的角色或场景上。比如用一段街舞视频的动作,驱动一个卡通角色跳舞。
多参考锁定。 通过多张参考图片和视频,锁定角色身份、视觉风格、镜头运动和声音,确保跨镜头的一致性。最多 9 张图片 + 3 段视频 + 3 段音频的参考容量,在当前商业模型中属于顶级配置。
6.4 多镜头叙事
H3 支持在单次生成中包含多个镜头,保持角色和风格的跨镜头一致性。这对于短叙事内容非常重要——一个 15 秒的视频可能需要包含开场远景、中景对话和特写收尾三个镜头,每个镜头的构图和景别不同,但主角的外貌、服装和声音必须保持一致。
!Multi-shot narrative schematic
图 13:单次生成内多镜头(Wide → Medium → Close)一致性示意。
多镜头建模是 Hailuo 系列的传统强项[10]。H3 在此基础上进一步强化了原生多镜头能力,无需用户手动指定镜头切换点,模型会根据提示词中的时间标记和叙事节奏自动安排镜头调度。
不过,15 秒的时长上限意味着每个镜头的平均时长只有 3–5 秒。对于需要更长镜头或更多镜头切换的复杂叙事,仍然需要分段生成后在剪辑软件中拼接。
Extend Video(视频延长)。 如果 15 秒不够,H3 提供了视频延长功能:在已有生成结果的基础上,继续生成下一段视频,将总时长延长至约 30 秒。每次延长都需要一次新的生成任务,模型会基于当前视频的最后一帧和原始上下文继续创作。延长后的视频在镜头衔接上通常比较平滑,但角色和风格的跨段一致性仍然需要通过参考素材来辅助维持。对于超过 30 秒的需求,建议在剪辑软件中进行多段拼接和统一调色。
6.5 文字与品牌渲染
H3 在文字渲染方面有明显提升,官方声称可以高精度呈现文字、Logo 和产品细节[1][6]。早期实测也表明,H3 对小型、清晰的 Logo 和主标题比较友好,能够准确生成品牌名称和简单的标语。
但需要设定合理的预期:这里的"高精度"是相对于前代模型而言的提升,而不是排版系统级别的像素精确复现。密集小字、复杂 UI 文本、多行段落等场景仍然容易出现拼写错误、字符变形或布局漂移。
从官方样例来看,H3 在以下文字场景中表现较好:
- 产品网站/电商页面:大字号的产品名称、价格标签、简洁的按钮文字
- 电影片头字幕:单行或双行的品牌标语,如官方示例中的"STILL MOVING"
!Film opening titles demo frame
图 14:官方 Film Opening Titles 用例截帧(文字/片头渲染参考)。来源:MiniMax H3 官方 demo。
- 动态海报:简短的品牌名称和核心信息
而以下场景则需要谨慎对待:
- 密集的小字号说明文字
- 多行段落或长句子
- 复杂的 UI 界面元素(菜单、表格、数据图表)
- 非拉丁字符(中文、日文、阿拉伯文等)的渲染准确度
涉及品牌内容时,建议将 H3 生成的视频视为初稿,关键的文字和 Logo 仍然需要在后期软件中复核和修正。
一些实用的文字渲染技巧:
- 需要在视频中出现的文字,必须在提示词中完整写出,并加上"必须准确呈现,不要拼错"之类的约束
- 尽量使用简短、清晰的文字,避免长句子
- 生成多个变体,挑选文字最准确的版本
6.6 运动物理与时空一致性
从 Artificial Analysis 的盲测结果来看,H3 的整体运动质量和时间一致性已处于行业头部。固定 24fps 的输出保证了运动的流畅性,官方样例中展示了人物行走、产品旋转、镜头推拉等多种动态场景。
但盲测排行榜没有单独测量身份漂移、肢体拓扑错误、遮挡恢复、三维几何稳定性或物理守恒等细粒度指标。以下场景仍然属于高风险区域:
- 复杂多人交互(如握手、拥抱、打斗)
- 手与物体的精细接触(如写字、弹琴、翻书)
- 镜面反射和透明材质
- 快速遮挡和重新出现
- 精密机械运动
- 连续多镜头的因果关系
这些不是 H3 独有的问题,而是当前所有视频生成模型共同面临的挑战。在使用 H3 进行商业化生产时,建议对这些高风险场景进行充分的 A/B 测试,不要仅凭官方样例做判断。
七、适用场景
H3 的能力组合——多模态参考、原生 2K、原生音频、指令式编辑——决定了它在某些场景中具有明显优势,而在另一些场景中则并非最佳选择。这一章按适配程度从高到低排列,帮你快速判断 H3 是否适合你的需求。
> 若你更关心广告、电商或竖屏短内容能否马上出片,可先打开 minimaxh3.art,用产品图或一段提示词生成带音频的 2K 级短视频,再对照下文的场景与选型建议。
图 15:H3 官方/产品侧用例拼图(片头、产品站、广告电商、品牌时尚等)。来源:MiniMax 博客 demo 抽帧 + Hailuo 产品封面。
图 16:场景适配度总览(High fit / Caveats / Avoid)。英文示意。
7.1 高度适配的场景
短广告与产品视频。 这是 H3 最核心的应用场景。社交广告的天然时长就是 10–15 秒,恰好落在 H3 的最佳输出区间。原生 2K 直接满足高清交付规格,原生立体声省去了单独的音频制作步骤,多参考输入可以锁定产品外观和品牌风格。一条 10 秒 2K 广告片的生成成本约 20–30 元人民币(含 2–3 次迭代),远低于传统制作方式。
电商商品视频。 电商场景对视频的核心要求是"产品要准、动作要自然、尺寸要对"。H3 的多参考输入可以同时提供产品正面图、侧面图、使用场景图,确保生成的视频中产品外观与实物一致。6 种宽高比的支持意味着同一组素材可以快速生成适配不同投放平台(横屏信息流、竖屏短视频、方形电商详情页)的视频。
品牌影片与动态海报。 品牌方通常已经积累了大量视觉资产。H3 的全能参考模式可以将这些资产直接作为输入,通过文字描述它们在新视频中的角色,快速产出品牌内容。对于需要频繁更新素材的品牌社交媒体运营来说,这种"基于已有资产再创作"的能力尤其有价值。
对已有视频的编辑与重构。 H3 的指令式编辑在 Artificial Analysis 的盲测中排名第一(Elo 约 1130),大幅领先第二名。这意味着当你需要对已有视频进行"换风格、换人物、换背景、加声音"等操作时,H3 是当前最值得优先考虑的选择。
7.2 适合但需注意局限的场景
竖屏短剧与叙事内容。 15 秒虽然不长,但足以容纳一个完整的"开场—发展—收尾"的短叙事结构。多镜头建模和角色一致性能力支持在单次生成中完成多镜头切换。但对于更长的连续剧情,需要分段生成并在剪辑软件中拼接,跨段一致性需要通过参考素材来维持。
游戏 CG 与角色 PV。 风格化输出、角色一致性和多镜头叙事能力使 H3 适合制作游戏宣传素材。但对于需要精确骨骼绑定、物理引擎模拟或高帧率的场景,H3 的能力仍然有限。
音乐视觉与表演片段。 H3 的原生音频能力使其特别适合音乐驱动的视觉内容。MV 场景、专辑预告、节拍驱动的视觉循环等,都可以利用 H3 的音画同步能力来制作。关键的测试点是:生成的运动和剪辑节奏是否与音频节拍对齐。
预可视化与创意测试。 即使最终项目采用传统拍摄,H3 也可以帮助导演和创意团队在投入制作成本之前,快速可视化镜头运动、场景构图、光线方向和动作时机。具体来说:
- 广告公司:在提案阶段,用 H3 快速生成 3–5 个不同风格的视觉方案,让客户直观感受"这个创意拍出来大概是什么样",避免仅凭文字提案导致的理解偏差。
- 导演/摄影指导:在分镜阶段,用 H3 测试不同的运镜方案(推拉、环绕、手持、斯坦尼康),提前预判哪种镜头语言最能表达叙事意图。
- 营销团队:在 A/B 测试中,用 H3 快速生成多个版本的广告素材,测试不同视觉风格、人物形象或产品展示方式对用户转化率的影响。
电影片头与片尾。 H3 的原生 2K + 立体声 + 文字渲染组合,使其特别适合制作电影片头、片尾和预告片素材。官方样例中展示了品牌片头案例——包含开场运镜、人物出场、文字淡入和音效同步,整个流程在一次生成中完成。对于独立电影制作人和短视频创作者来说,这意味着不再需要昂贵的后期合成软件来制作片头。
游戏 UI 动画与界面演示。 H3 对菜单、HUD 元素和文字叠加的渲染保持可读,适合制作游戏 UI 动画、角色选择界面演示和游戏内过场动画的概念验证。对于游戏开发者来说,H3 可以快速将 UI 设计稿转化为动态演示视频,用于内部评审或玩家测试。
7.3 不太适合的场景
实时直播与互动数字人。 H3 的 API 是异步接口,不支持流式返回或实时生成。当前的生成延迟在数十秒到数分钟量级,无法满足实时互动的需求。对于直播和数字人场景,应该选择专门的实时驱动模型。
超长视频(>30 秒)的连续叙事。 单次 15 秒、Extend 约 30 秒的上限,意味着 H3 无法直接生成长镜头或连续剧级别的内容。对于这类需求,Seedance 2.5(单次 30 秒 + 多轮延长至数分钟)或 Kling 3.0 的多镜头方案可能更合适。
需要 4K 或更高分辨率的场景。 H3 的最高输出为 2K(约 1440p)。对于需要 4K 交付的场景(如大屏展示、院线级内容),H3 的分辨率仍然不足。Kling 3.0 支持原生 4K,Veo 3.1 在 8 秒内支持 4K,可以作为替代方案。
涉及敏感内容的高合规场景。 明星肖像、声音克隆、知名影视角色、品牌素材等场景,涉及肖像权、版权和声音权等法律问题。Hailuo 平台目前仍面临 Disney、Universal 等权利方的版权诉讼(详见第 12.3 节)。在这些场景中使用 H3 前,务必取得明确授权,并保存完整的审计记录。
八、定价与成本
H3 在定价上的激进程度,是它在发布后迅速引起关注的重要原因之一。官方明确表示 2K 价格"不到主流模型的三分之一" [1],早期测试者报告 15 秒 2K 片段约 $1(Seedance 同长度 1080p 约 $4)[5],第三方平台的交叉验证基本确认了这一说法 [8][9]。
!Approx price per second comparison
图 17:约略每秒价格对比(美元,文中引用近似值,非实时报价)。
8.1 官方定价(MiniMax 开放平台)
| 档位 | 价格 | 说明 |
|---|---|---|
| 2K(默认) | $0.13/秒(约 0.80 元/秒) | 当前主推档位 |
| 768p | $0.09/秒(约 0.50 元/秒) | 发布时仍处于有限开放状态 |
计费方式为按输出视频秒数,生成失败或被拒绝的任务全额退款。
8.2 参考素材的额外费用
| 素材类型 | 费用 |
|---|---|
| 参考音频 | 免费,不计费 |
| 参考图片(前 5 张) | 免费 |
| 参考图片(第 6 张起) | $0.04/张(约 0.20 元/张) |
| 参考视频 | 按输出分辨率和输入视频时长计费 |
这里的定价逻辑很清晰:音频和基础图片免费,鼓励用户多用参考素材来提升生成质量;视频参考因为消耗更多计算资源,所以按输入时长额外收费。
8.3 第三方平台定价
H3 已上线多个第三方平台,定价略有差异:
| 平台 | 2K 价格 | 说明 |
|---|---|---|
| EvoLink | $0.130/秒(8.84 cr/秒) | 与官方一致 |
| fal.ai | 约 $0.13/秒 | 与官方基本一致 |
| Atlas Cloud | 即将上线 | 价格待公布 |
| Vercel AI Gateway | 按量计费 | 价格待公布 |
第三方平台的定价通常与官方持平或略有溢价,但提供了更便捷的接入方式和统一的 API 格式。
8.4 实际成本估算
对于最常见的几种使用场景,成本大致如下:
| 场景 | 规格 | 成本(约) |
|---|---|---|
| 短文生视频测试 | T2V 5 秒 2K | $0.65(约 4.5 元) |
| 完整时长视频 | T2V 15 秒 2K | $1.95(约 13.5 元) |
| 参考视频测试 | R2V 5 秒 + 3 秒参考输入 | $1.04(约 7.2 元) |
| 10 秒广告片(含 2–3 次迭代) | T2V 或 I2V 10 秒 ×3 | 约 20–30 元人民币 |
| 1 分钟 2K 纯生成 | 4×15 秒 | $7.80(约 54 元) |
8.5 与竞品的价格对比
| 模型 | 价格(约) | 对比 H3 |
|---|---|---|
| MiniMax H3 2K | $0.13/秒 | — |
| Seedance 2.0 Standard | $0.25–0.30/秒 | 约 H3 的 2–3 倍 |
| Seedance 2.0 Mini | $0.12–0.15/秒 | 与 H3 接近,但最高 720p |
| Kling 3.0 Pro 1080p | $0.18–0.25/秒 | 高于 H3 |
| Veo 3.1 | 按 4/6/8 秒档位计费 | 短时长有竞争力,长视频成本攀升 |
| Wan 2.7(云端) | $0.10/秒左右 | 低于 H3,但最高 1080p |
| Wan 2.7(本地部署) | 仅硬件成本 | 零 API 费用 |
几个关键结论:
H3 的性价比优势在 2K 档位最为明显。 当你用 2K 输出时,H3 的成本大约只有 Seedance 2.0 Standard 的三分之一到二分之一,而 Elo 排名并不逊色。
768p 档位的竞争更激烈。 Seedance 2.0 Mini 和 Wan 系列在低分辨率档位的价格与 H3 接近甚至更低,此时 H3 的价格优势不再突出,选择更多取决于质量和功能差异。
本地部署是成本的终极答案。 如果 MiniMax 如期开放权重,且 H3 能在消费级显卡上运行(这一点目前完全不确定),那么本地部署将彻底消除 API 费用。但权重开放的时间表、许可证条款和硬件需求仍然是未知数。
九、全面横向对比
这是全文信息密度最高的章节。我们将 H3 与当前市场上所有主要竞品进行逐一对比,涵盖技术规格、能力特性、价格、Elo 排名和适用场景。
9.1 总览对比表
首先从核心规格和能力两个维度拉通对比。
图 18:竞品规格/价格/编辑能力 condensed 对照(基于第 9.1 节表格,英文示意)。
核心规格对比:
| 维度 | H3 | Seed 2.0 | Seed 2.0 Mini | Seed 2.5 | HappyHorse | Wan 2.7 | Kling 3.0 | Veo 3.1 | Sora 2 Pro |
|---|---|---|---|---|---|---|---|---|---|
| 发布方 | MiniMax | ByteDance | ByteDance | ByteDance | 阿里 ATH | 阿里 Tongyi | 快手 | OpenAI | |
| 最高分辨率 | 原生 2K | 1080p | 720p | 1080p | 1080p | 1080p | 原生 4K | 4K(仅 8s) | 1080p |
| 最长时长 | 15s | 15s | 15s | 30s | 15s | 15s | 15s | 8s | 20s |
| 原生音频 | 立体声 | 立体声 | 是 | 立体声 | 多语言口型 | 后期支持 | 5 语言对白 | 对白+音效 | 同步音频 |
| 参考文件数 | ≤12 | ≤12 | 简化 | ~50 | ≤9图 | 5+1 | — | 3 图 | — |
| 开源 | 即将开放 | 闭源 | 闭源 | 闭源 | 未公开 | Apache 2.0 | 闭源 | 闭源 | API 9月终止 |
能力与价格对比:
| 维度 | H3 | Seed 2.0 | Seed 2.5 | HappyHorse | Wan 2.7 | Kling 3.0 | Veo 3.1 | Sora 2 Pro |
|---|---|---|---|---|---|---|---|---|
| 编辑能力 | 指令式(AA #1) | 参考驱动 | 参考驱动 | 角色锁定 | 指令编辑 | 元素绑定 | 场景延长 | 视频编辑 |
| 核心优势 | 2K+编辑+性价比 | 多参考+叙事 | 超长时长 | 多语言口型 | 开源部署 | 4K+多镜头 | 物理真实感 | ChatGPT 集成 |
| 价格(/秒) | ~$0.13 | ~$0.25 | 略高于 H3 | ~$0.18 | ~$0.10 | ~$0.20 | 按档位 | ~$0.30 |
这两张表清楚地展示了 H3 的定位:在 2K 分辨率、多模态参考、编辑能力和价格之间取得了当前最好的平衡。 它不是每个单项都最强——Kling 3.0 支持 4K,Seedance 2.5 支持更长时长,Wan 2.7 支持本地部署——但在综合维度上,H3 的"性价比 × 能力组合"是最有竞争力的。
接下来我们逐一对比。
9.2 H3 vs Seedance 2.0
这是发布后讨论最多的对比。两者在很多维度上非常接近,但在"性格"上有明显差异。
规格对比:
| 维度 | MiniMax H3 | Seedance 2.0 |
|---|---|---|
| 最高分辨率 | 原生 2K(约 2560×1440) | 480p/720p/1080p(原生) |
| 最长时长 | 15 秒(Extend ~30s) | 15 秒 |
| 参考输入 | ≤12 文件 | ≤12 文件 |
| 音频 | 双声道立体声 | 双声道立体声 |
| 编辑方式 | 指令式编辑 | 参考驱动 |
| 价格(2K) | ~$0.13/秒 | ~$0.25–0.30/秒(1080p) |
| 开源 | 即将开放 | 闭源 |
Elo 排名对比(Artificial Analysis 带音频盲测,2026年8月1日数据)[3]:
图 19:H3 vs Seedance 2.0 Elo 对比(T2V / I2V / Edit)。数据来源:文中引用的 Artificial Analysis。
| 任务 | H3 | Seedance 2.0 |
|---|---|---|
| 文生视频(T2V) | 1242(第二) | 1225 |
| 图生视频(I2V) | 1184 | 1196(领先 12 分) |
| 视频编辑 | 1130(第一) | 1035(差距 95 分) |
核心差异:
H3 对 Seedance 2.0 的优势主要集中在编辑,而非所有生成模式。视频编辑 Elo 相差 95 分,差距非常明显;文生视频 H3 领先 17 分,但置信区间和榜首模型高度接近;图生视频则是 Seedance 领先 12 分。
两者在用户实测中的印象差异可以用一句话概括:H3 更懂"成片像什么",Seedance 更精确执行"做什么"。H3 生成的视频在整体观感、连贯性和"成片感"上更出色;Seedance 在指令遵循和运动流畅度上更强。
价格方面,H3 的 2K 档位(~$0.13/秒)大约是 Seedance 2.0 1080p 档位的三分之一到二分之一,性价比优势明显。
结论: 短商业片、广告电商、品牌内容优先选 H3;灵活多参考、音乐驱动、多镜头叙事优先选 Seedance 2.0。两者互补,常可在同一工作流中组合使用。
9.3 H3 vs Seedance 2.0 Mini / Fast
Seedance 2.0 的轻量版本,面向高量迭代和成本敏感场景。
| 维度 | MiniMax H3 | Seedance 2.0 Mini |
|---|---|---|
| 最高分辨率 | 原生 2K | 最高 720p |
| 价格 | ~$0.13/秒 | ~$0.12–0.15/秒 |
| 质量 | 全功能版本 | 质量略有妥协 |
| 速度 | 标准 | 更快 |
两者价格接近,但 H3 的输出分辨率是 Seedance Mini 的近三倍。Seedance Mini 的优势在于速度更快,适合需要大量生成、快速筛选的草稿阶段。
结论: 草稿阶段和高量迭代用 Seedance Mini;精细控制和最终成片用 H3。
9.4 H3 vs Seedance 2.5
Seedance 2.5 是 ByteDance 于 2026 年中发布的升级版本,核心卖点是超长时长和大规模参考输入,直接瞄准了 H3 的 15 秒时长短板。
| 维度 | MiniMax H3 | Seedance 2.5 |
|---|---|---|
| 最高分辨率 | 原生 2K | 1080p |
| 单次最长时长 | 15 秒(Extend ~30s) | 30 秒 |
| 多轮延长 | 手动逐段 | 多轮延长至数分钟 |
| 参考文件数 | ≤12 文件(9图+3视+3音) | 约 50 文件 |
| 音频 | 双声道立体声 | 双声道立体声 |
| 价格 | ~$0.13/秒 | 略高于 H3 |
Seedance 2.5 的核心优势是时长和参考规模。单次 30 秒 + 多轮延长至数分钟的能力,使其可以直接生成完整的短片、产品介绍或连续剧情,无需在剪辑软件中手动拼接。50 级参考文件的上限更是远超 H3 的 12 文件限制,适合需要大量品牌资产、多角色设定和复杂场景参考的重度项目。
H3 的优势则在于分辨率更高(2K vs 1080p)、价格更低、编辑能力更强(Elo 1130)。对于 15 秒以内的短视频,H3 的综合性价比仍然更优。
两者的关系更多是互补而非替代:H3 适合快速、精准、高性价比的短商业片;Seedance 2.5 适合需要更长时长和更多参考的叙事内容。一个务实的工作流是用 H3 做分镜和短镜头,用 Seedance 2.5 做长镜头和连续剧情。
9.5 H3 vs Kling 3.0(快手)
Kling 3.0 是快手旗下的旗舰视频模型,以原生 4K、多镜头和电影感著称。
| 维度 | MiniMax H3 | Kling 3.0 |
|---|---|---|
| 最高分辨率 | 原生 2K | 原生 4K |
| 最长时长 | 15 秒 | 15 秒 |
| 多镜头 | 支持 | 强(最多约 6 镜头) |
| 音频 | 立体声 | 5 种语言对白 + 口型同步 |
| 多模态参考 | 9图+3视+3音(≤12) | 相对有限 |
| 编辑能力 | 指令式编辑(AA #1) | 元素/角色绑定 |
| 价格 | ~$0.13/秒 | ~$0.18–0.25/秒 |
| AA 编辑 Elo | 1130(第一) | ~1000 |
Kling 3.0 的核心优势是4K 分辨率和多镜头调度。在需要极高画面精度(如大屏展示、院线级内容)或多角色电影感叙事的场景中,Kling 更有竞争力。
H3 的优势则在于全能参考灵活性、编辑能力和价格。当你的工作流涉及大量参考素材的组合与编辑时,H3 的 12 文件参考上限和指令式编辑能力是 Kling 无法匹配的。
结论: 4K 和电影感叙事优先选 Kling;多模态参考、编辑迭代和性价比优先选 H3。
9.6 H3 vs Google Veo 3.1
Veo 3.1 是 Google 旗下的旗舰视频模型,以物理真实感和高保真音频著称。
| 维度 | MiniMax H3 | Veo 3.1 |
|---|---|---|
| 最高分辨率 | 原生 2K | 4K(仅 8 秒) |
| 最长时长 | 15 秒 | 8 秒(常规单次) |
| 参考输入 | 9图+3视+3音(≤12) | 3 张参考图 |
| 音频 | 立体声 | 48kHz 高保真对白 |
| 物理真实感 | 行业头部 | 最强之一 |
| 价格 | ~$0.13/秒 | 按 4/6/8 秒档位计费 |
Veo 3.1 的核心优势是物理真实感和高保真音频。在需要极致写实(如产品细节、自然场景、人物皮肤质感)的场景中,Veo 的画面质量是行业标杆。其 48kHz 对白质量也明显优于大多数竞品。
H3 的优势则在于时长更长、多模态参考更全能、价格更有竞争力。Veo 的常规单次输出仅 8 秒,且仅支持 3 张参考图,对于需要多素材组合的工作流来说远远不够。
结论: 极致写实和高保真音频优先选 Veo;时长、多模态参考和性价比优先选 H3。
9.7 H3 vs HappyHorse 1.1(阿里 ATH)
HappyHorse 是阿里巴巴旗下的视频模型,以多语言口型同步和角色一致性著称。
| 维度 | MiniMax H3 | HappyHorse 1.1 |
|---|---|---|
| 最高分辨率 | 原生 2K | 1080p |
| 最长时长 | 15 秒 | 15 秒 |
| 多语言口型 | 有(主要中英文) | 强(约 7 种语言) |
| 角色一致性 | 跨镜头 | 强(最多 9 主体锁定) |
| 多模态参考 | 9图+3视+3音(≤12) | ≤9图(R2V) |
| 编辑能力 | 指令式编辑 | 角色/场景编辑 |
| 价格 | ~$0.13/秒 | ~$0.18/秒 |
HappyHorse 的核心优势是多语言口型同步。在需要角色用多种语言说话(如出海品牌的本地化广告)的场景中,HappyHorse 的口型准确度和自然度明显优于大多数竞品。其最多 9 主体的角色锁定能力,也使其在多角色叙事中表现出色。
H3 的优势则在于多模态参考更全面、编辑能力更强、价格更低。HappyHorse 的参考输入主要限于图片(R2V),不支持视频和音频参考;H3 的全能参考模式可以同时利用图片、视频和音频,控制面更广。
结论: 多语言口型和多角色锁定优先选 HappyHorse;多模态参考、编辑和性价比优先选 H3。
9.8 H3 vs Wan 2.1/2.7(阿里通义万相)
Wan 系列是阿里巴巴开源的视频模型,以 Apache 2.0 许可证和本地部署能力著称。
| 维度 | MiniMax H3 | Wan 2.7 |
|---|---|---|
| 最高分辨率 | 原生 2K | 1080p |
| 最长时长 | 15 秒 | 15 秒 |
| 音频 | 原生立体声 | 后期版本支持 |
| 开源 | 即将开放 | 是(Apache 2.0) |
| 本地部署 | 待权重开放 | 已可本地部署 |
| 云端价格 | ~$0.13/秒 | ~$0.10/秒 |
| 开箱商用体验 | 完整 API + 产品界面 | 需自行部署调优 |
Wan 系列的核心优势是开源和本地部署。Apache 2.0 许可证意味着你可以自由使用、修改和部署,无需支付 API 费用,也无需担心数据外泄。对于需要私有化部署、模型微调或研究用途的团队来说,Wan 是目前最友好的选择。
H3 的优势则在于开箱即用的商用体验。MiniMax 提供了完整的 API、产品界面、第三方平台接入和异步任务管理,开发者无需关心模型部署、GPU 管理和推理优化。对于需要快速上线、快速迭代的商业项目来说,H3 的时间成本远低于自行部署 Wan。
结论: 本地部署、开源定制、研究/二次开发优先选 Wan;开箱商用、快速迭代优先选 H3。
9.9 H3 vs Sora 2 Pro(OpenAI)
Sora 是 OpenAI 旗下的视频模型,以长时长和平台集成著称。
| 维度 | MiniMax H3 | Sora 2 Pro |
|---|---|---|
| 最高分辨率 | 原生 2K | 1920×1080 |
| 最长时长 | 15 秒(Extend ~30s) | 20 秒 |
| 多模态参考 | 9图+3视+3音频(≤12) | 图片条件和视频编辑 |
| 音频 | 原生立体声 | 同步音频 |
| 平台集成 | Hailuo AI + API | ChatGPT 集成 |
| 价格 | ~$0.13/秒 | ~$0.30/秒 |
但需要注意:OpenAI 已于 2026 年 4 月停止了 Sora 网页和应用体验,API 计划于 2026 年 9 月终止 [4]。 这意味着 Sora 不再是新视频工作流的可靠选择。
结论: 如果你已经在使用 Sora,建议尽早迁移;对于新项目,H3 是更稳定、更便宜、功能更全面的选择[4]。
9.10 历史研究模型简述
为了完整性,这里简要提及几个具有代表性的历史研究模型:
- Imagen Video(Google,2022):级联视频扩散模型,代表早期"7 级超分管线"的技术路线。输出 1280×768、5.3 秒、24fps,无音频。学术意义大于实用价值。
- Phenaki(Google,2022):连续文本提示驱动的可变长度视频。核心创新是 C-ViViT 离散视频 tokenizer 和双向掩码 Transformer。分辨率较低,主要贡献在于"随时间变化的提示"这一概念。
- Make-A-Video(Meta,2022):代表"图像数据学语义、视频数据学运动"的早期迁移路线。从文本图像模型迁移空间知识,结合无标签视频学习运动。
这些模型在技术史上有重要地位,但不应与 2026 年的商业产品直接按主观样例比较。
十、Prompt 最佳实践
H3 的提示词上限为 7000 字符 [9],远高于多数竞品。官方示例和社区实测都表明,结构化、时间线式的长提示词效果远好于简短的一句话描述[1][6][10]。把提示词当成"制片文件"来写,而不是"场景描述",是使用 H3 的核心心法。
10.1 核心原则
- 给每个参考素材明确分工。 不要让模型猜"这张图片是用来做什么的"。直接写明"图1 提供产品外观,图2 提供模特外貌,视频1 提供运镜方式,音频3 提供歌声"。
- 用时间标记控制节奏。 即使是短视频,也建议加上
[0s-3s]、[3s-8s]等时间节拍。实测表明,带时间标记的提示词对节奏的控制明显提升。 - 视觉指令与音频指令分开写。 因为音画是同一次生成,混在一起容易让模型困惑。
- 需要可读的文字必须明确写出。 如果你希望视频中出现品牌名称或标语,必须在提示词中完整写出,并加上"必须准确呈现,不要拼错,不要添加其他文字"之类的约束。否则很容易生成乱码或噪点。
- 明确锁定与禁止项。 "保持服装不变"、"不要字幕"、"不要水印"之类的约束可以有效减少漂移和多余元素。
- 尽量用长而结构化的提示词。 官方强示例普遍较长且结构化,短而模糊的提示词效果明显更差。
10.2 推荐结构(六块法)
图 20:Prompt 六块法结构卡(Reference Roles → Negatives)。
| 模块 | 内容 | 作用 |
|---|---|---|
| 1. 参考分工 | 每张图/视频/音频的具体用途 | 防止模型乱猜素材角色 |
| 2. 时间节拍 | 带时间点的动作与镜头调度 | 控制节奏与叙事结构 |
| 3. 视觉风格 | 光线、色调、镜头语言、质感 | 统一成片观感 |
| 4. 声音轨道 | 对话、音效、音乐及进入时间 | 音画同步更精准 |
| 5. 限制与锁定 | 必须保持 / 禁止出现的内容 | 减少漂移与多余元素 |
| 6. 负面提示(可选) | 不要 XXX | 进一步约束输出 |
10.3 示例一:纯文生视频(品牌片头)
弱提示词(效果差):
> 一个女孩在雨中走路,电影感
强提示词(效果好):
```text 15秒,16:9,电影感品牌片头。
[0s-4s] 广角定场:雨夜空旷城市街道,霓虹倒映在湿地上,镜头缓慢推进。 [4s-9s] 中景:一位穿黑色风衣的年轻女性撑伞从画面右侧走进,步伐坚定,雨水打在伞面上。 [9s-13s] 特写:她抬头看向远方,眼神坚定,雨水顺着脸颊流下。 [13s-15s] 镜头缓缓拉远,画面中央淡入白色标题"STILL MOVING",字体干净有力。
视觉风格:高对比度霓虹色调,轻微胶片颗粒,冷暖对比强,电影级调色。 声音:全程低沉雨声与远处车流,4秒处加入轻微钢琴旋律,13秒处标题出现时加一声清脆打击。 限制:人物服装保持黑色风衣,不要字幕,不要水印,标题文字必须准确呈现"STILL MOVING"。 ```
10.4 示例二:多模态参考生成
场景: 用参考视频的运镜 + 参考图人物 + 参考音频歌声
```text 参考分工:
- 视频1:提供希区柯克式运镜(推轨 + 变焦)
- 图2:人物外貌与服装参考(必须保持一致)
- 音频3:歌声与情感参考
15秒,16:9。
[0s-5s] 人物站在空旷舞台中央,灯光从上方打下,镜头采用视频1的希区柯克运镜缓慢推进并变焦。 [5s-12s] 人物开始唱歌,口型与情绪严格跟随音频3,身体随音乐轻微摆动。 [12s-15s] 镜头继续推进至面部特写,灯光逐渐变暗,只剩人物轮廓。
视觉风格:舞台戏剧光,深黑背景,高对比,电影质感。 声音:完全使用音频3的歌声,环境只有轻微回响,不要额外音乐。 限制:人物外貌、发型、服装必须与图2完全一致;口型与音频3精准同步;不要字幕,不要水印。 ```
10.5 示例三:产品广告(电商场景)
```text 参考分工:
- 图1:产品主体(白色智能耳机)
- 图2:模特手部与使用场景参考
10秒,9:16竖屏。
[0s-3s] 产品静置在干净白色台面上,柔和侧光,镜头缓慢环绕。 [3s-7s] 模特手拿起耳机戴上,动作自然流畅,特写耳机细节与耳部贴合。 [7s-10s] 切换到生活场景:模特在咖啡馆微笑,耳机闪着微光,画面定格并淡入品牌文字"SOUND THAT MOVES"。
视觉风格:干净商业广告质感,柔光,高细节,浅景深。 声音:轻快电子氛围音乐,3秒处加入轻微点击音效,7秒处加入人声轻笑。 限制:产品外观必须与图1完全一致;文字必须准确呈现"SOUND THAT MOVES";不要多余文字,不要水印。 ```
10.6 示例四:指令式编辑
```text 基于上传的原始视频进行编辑:
保留原视频的运镜、节奏与人物动作。 将背景从室内客厅替换为海边日落沙滩。 人物服装改为白色连衣裙。 添加轻微海浪声与远处海鸥声,替换原有背景音。 保持人物面部表情与口型不变。
限制:只修改指定元素,其他所有运动、光照、节奏保持原样;不要添加字幕。 ```
10.7 常见坑与避坑指南
| 问题 | 原因 | 解决方法 |
|---|---|---|
| 文字变成乱码或噪点 | 提示词中没有明确写出需要的文字 | 在提示词中完整写出,并加"必须准确呈现"约束 |
| 参考素材的作用被模型猜错 | 没有给素材分配明确角色 | 在"参考分工"模块中逐条说明每个素材的用途 |
| 节奏松散、动作拖沓 | 缺少时间标记 | 加上 [0s-3s] 等时间节拍 |
| 输出出现多余元素(字幕、水印) | 没有明确禁止 | 在限制模块加上"不要字幕、不要水印" |
| 参考过多导致效果下降 | 一次性塞满 12 个文件但未分配任务 | 优先用 3–5 个高质量参考,明确分工 |
| 生成速度很慢 | 参考视频/音频文件过大 | 压缩参考素材至最低可用质量 |
10.8 社区实战案例:创作者们怎么用 H3
H3 发布仅一天,X(Twitter)上已涌现大量创作者的真实使用案例。这些案例比官方样例更接地气,也更能反映 H3 在实际工作流中的表现。以下是按场景分类的精选案例,附带工作流要点,可直接作为你的创作参考。
图 21:社区案例截图 — @maxescu 电影感多镜头试片(发布当日高互动)。来源:X 页面截图。
图 22:社区案例截图 — @fal 动漫片头 + 提示词配乐时间轴。来源:X 页面截图。
图 23:社区案例截图 — @hafuma 二次元原创短片。来源:X 页面截图。
!Community case @ai_for_success
图 24:社区案例截图 — @ai_for_success 单图 15 秒产品广告。来源:X 页面截图。
品牌片头与字幕渲染
案例 1:动漫片头 + 提示词配乐时间轴(@fal,78 ❤)
创作者 fal 用 5 张静帧作为参考,生成了一段 15 秒的动漫风格片头。最关键的技巧是:在提示词里直接写配乐的时间节点——low beat at 3s, jazz bass at 6s...,让模型在生成画面的同时,按节拍同步生成背景音乐。这验证了 H3 的"提示词即配乐表"的可能性。
案例 2:动漫 OP + 屏幕大字不糊(@slash1sol,62 ❤)
slash1s 的动漫开场视频展示了 H3 在屏幕文字渲染上的能力——大字号标题在 2K 输出下保持清晰可读。这对于广告、游戏和品牌内容中的字卡需求来说是一个重要验证。
产品广告与电商
案例 3:单图生成 15 秒产品广告(@ai_for_success,12 ❤)
Ashutosh 只用了一张产品图片加一段提示词,就生成了一段 15 秒的商用级产品广告视频。这展示了 H3 图生视频模式的实用性——对于电商卖家来说,只需要一张产品白底图,就能快速产出动态展示视频。
案例 4:真实客户广告——手机滚动 UI 文字(@0xInk_,43 ❤)
INK 在为法国客户制作广告时,主片使用了其他模型,但手机滚动文字的镜头专门改用 H3,因为"字更干净"。这是一个非常实际的工作流案例:不一定整个视频都用 H3,而是把它用在最擅长的部分——文字渲染和特定镜头。
案例 5:夏日菜单竖屏电商(@thisismariaa25,73 ❤)
Maria 将一份菜单概念转化为电影感的 9:16 竖屏动态视频,适合餐饮和本地生活类电商场景。这验证了 H3 在竖屏内容上的表现,以及将静态设计稿"动起来"的工作流。
多模态参考与工作流
案例 6:写实惊悚短片 + 双图锁身份(@Diplomeme,53 ❤)
Murphy 用两张参考图分别锁定角色身份(Image1:人物与服装)和环境(Image2:桥梁与城市),再在提示词中写入分镜时间码,生成了一段写实风格的惊悚短片。这是"双图分工"的经典用法——一张图管人物,一张图管场景,互不干扰。
案例 7:AE 粗动画 → 驱动真实画面(@seiiiiiiiiiiru,24 ❤)
SEIIIRU 的工作流非常有创意:先在 After Effects 中制作简单的图形动画,然后将这段动画作为参考视频输入 H3,让 H3 按照动画的节奏和运动模式"动"一张静态照片。这展示了 H3 V2V 动作迁移的一个巧妙应用场景——用粗糙的运动参考驱动精细的画面生成。
案例 8:Omni Reference 商用工作流讲解(@YaseenK7212,26 ❤)
Yaseen 展示了一个完整的多模态参考工作流:混合文本、图片、音频和视频作为输入,强调跨镜头一致性。他的案例覆盖了广告、游戏和品牌内容三个场景,是理解全能参考模式的最佳入门案例之一。
案例 9:六图资产 + 参考视频节奏合成(@influencer_seo,4 ❤)
Bennett 用 6 张图片作为"视觉积木"(产品、人物、场景等),再用 1 段参考视频提供节奏、转场和音乐气氛。这是"图片拼积木 + 视频给节奏"的经典多参考工作流,适合素材丰富但需要快速合成的场景。
电影感与叙事
案例 10:电影感多镜头试片合集(@maxescu,266 ❤ / 21k views)
Alex Patrascu 的电影感试片是发布当天热度最高的 H3 案例之一。15 秒、2K、约 12 个参考素材(图片/视频/音频),展示了 H3 在多镜头调度、光线一致性和电影质感上的综合实力。
案例 11:喷气机编队 + 天空字(@Kuriyama890,26 ❤)
15 秒原生 2K,多镜头切换:编队飞行、特写、点火、天空写字"3 is coming"。这是一个展示 H3 多镜头叙事和宏大场景能力的典型案例。
动漫与二次元
案例 12:二次元原创短片(@hafuma,119 ❤)
Hafuma 的二次元角色驱动短片获得了社区高度互动。这验证了 H3 在动漫风格内容上的表现——角色一致性、动作流畅度和风格保持都达到了创作者可接受的水准。
案例 13:竖屏角色对口型(@qaHEqxyzUF99214,18 ❤)
首次尝试对口型(lip-sync),生成了一段竖屏角色说话视频。这展示了 H3 原生音频在口型同步方面的能力,适合口播内容和角色互动场景。
小结
从这些社区案例中可以提炼出几个共性:
- 参考素材的分工越明确,效果越好。 双图锁身份+环境、六图拼积木+视频给节奏,都是"分工明确"的典型模式。
- 提示词写得像制片文件的创作者,成片质量明显更高。 配乐时间轴、分镜时间码、音画分离描述,都是让模型"听懂你想要什么"的关键。
- H3 不一定要包揽整个视频。 把它用在最擅长的部分(文字渲染、多模态参考、特定镜头),与其他模型组合使用,往往是效率最高的工作流。
- 竖屏、动漫、写实、商业——风格覆盖面很广。 H3 不是只能做某一种风格,但每种风格的提示词写法需要相应调整。
十一、开源与生态
在 H3 的所有战略变量中,开放权重的承诺可能是影响最深远的一个。如果兑现,H3 将成为当前性能最强的开放权重视频生成模型之一,直接改变行业的竞争格局。但这个"如果"的含金量,取决于三个关键问题:什么时候开放、以什么条件开放、以及开放后能不能跑起来。
图 25:Hailuo 产品 / MiniMax API / 开放权重(计划中)生态示意。
11.1 开源承诺:说了什么、做到哪一步
MiniMax 在 H3 的官方发布博客中明确表示,将在"符合法律法规的前提下"开放模型权重,支持社区定制与国产芯片适配。这个表述有几个值得注意的细节。
第一,"符合法律法规的前提下"这个前置条件并非套话。中国对大模型开放权重有明确的备案和审批要求,涉及训练数据合规、内容安全评测、算法备案等多个环节。这意味着 H3 的权重开放时间表不仅取决于 MiniMax 的技术准备,还取决于监管审批的进度。
第二,"国产芯片适配"是一个有意为之的信号。MiniMax 在设计初期就考虑了不同 AI 硬件的兼容性,媒体报道亦称其计划适配中国本土芯片(如华为昇腾、寒武纪等)。这与纯粹面向 NVIDIA GPU 的开源模型形成了差异,也暗示了 MiniMax 在企业级和政府级市场的野心。
实际进展方面, 截至 2026 年 8 月 1 日,Hugging Face 与 GitHub 上尚未出现可下载的 H3 权重、推理代码或正式模型许可证。MiniMax 之前开源的 M3 文本模型采用的是 MiniMax Community License,预计 H3 将沿用类似条款:非商用完全免费、年收入低于 2000 万美元的组织可商用(需注明 attribution 并通知 MiniMax)、更高收入需单独协商。
11.2 开源后的真实影响:不止是"能跑了"
如果 H3 权重如期开放,影响远不止"多了一个可以本地跑的模型"这么简单。我们需要从不同角色的视角来看这件事。
对于企业用户, 最直接的价值是数据安全。目前使用 H3 API 意味着所有参考素材——产品原型、品牌资产、未发布的广告创意——都要上传到 MiniMax 的云端。对于金融、医疗、政府等数据敏感行业,这是一道硬门槛。本地部署消除了这个顾虑,但代价是需要自建 GPU 集群和推理服务。H3 的参数量至今未披露,因此本地部署的硬件门槛完全未知——任何"单卡 24GB 可跑"或"需要 8 张 H100"的说法都属于无依据猜测。
对于创作者社区, 开放权重意味着可以针对特定风格进行微调。这在图像生成领域已经被充分验证——Stable Diffusion 开源后涌现的数万个 LoRA 模型,覆盖了从写实到动漫、从油画到赛博朋克的几乎所有视觉风格。H3 如果开放权重,类似的故事很可能在视频领域重演。你可以微调一个"你的品牌专属风格"的 H3,让所有生成的视频自动带有统一的视觉调性。
对于工具链生态, 可以预期 ComfyUI 和 Diffusers 等主流框架会快速适配。但与图像模型不同,视频模型的适配难度更高——需要处理时间维度的注意力机制、大规模潜变量的内存管理、以及音视频联合推理的流程编排。因此,工具链适配的速度可能比图像模型慢,最终的易用性也可能不如云端 API。
对于推理成本, 社区通常会在开源模型发布后快速推出量化版本和推理优化。但 H3 的架构复杂度(VAE + Omni Transformer + In-Context Regeneration + 音频联合生成)远高于典型的图像扩散模型,量化的可行性和性能损失需要实际验证。
11.3 第三方平台生态
H3 发布当天就已上线多个第三方平台,这种速度在 AI 视频模型中并不多见。以下是最值得关注的几个接入点:
fal.ai 是目前接入速度最快的第三方平台之一,已支持 T2V 和 I2V 两种模式,定价与官方基本一致(~$0.13/秒)。对于已经在使用 fal.ai 其他模型的开发者来说,切换到 H3 几乎没有额外成本。
EvoLink 提供了统一的视频 API 聚合服务,将 H3 与 Seedance、Kling、Wan 等模型放在同一个 API 网关后面。这种"多模型并行调用"的能力,对于需要在不同模型之间 A/B 测试的团队来说非常实用——你可以用同一套代码切换模型,直接比较输出质量。
PixVerse 在发布当天就发布了合作 demo(168 ❤),这表明 H3 的第三方平台策略不是被动等待接入,而是主动与平台方合作推广。
OpenArt 的集成方式比较特殊——它不仅接入了 H3 的 API,还提供了角色(Characters)功能,允许用户保存和复用角色参考。这与 H3 的多参考输入能力天然契合,对于角色驱动的叙事内容创作者来说是一个有吸引力的组合。
若更偏向网页端直接生成与预览,也可在 minimaxh3.art 使用 H3 的文生视频与图生视频流程。
11.4 MiniMax 生态的协同潜力
H3 不是孤立存在的。MiniMax 的产品矩阵还包括 M3 文本大模型和 Speech 系列语音模型,三者之间的协同空间值得认真看待。
最直接的协同是 M3 + H3 的内容生产流水线。M3 负责理解用户需求、生成分镜脚本和结构化提示词,H3 负责将提示词转化为视频。这种"L2L"(Language-to-Language → Language-to-Video)的工作流,可以将创意到成片的链条大幅缩短。
更深层的协同是 Speech + H3 的音频增强。H3 的原生音频虽然已经令人印象深刻,但在发音准确性和情感细腻度上仍然不如专业的语音合成模型。如果将 Speech 系列生成的高质量语音作为 H3 的参考音频输入,理论上可以同时获得专业级的语音质量和 H3 的口型同步能力。
当然,这些协同目前还停留在概念层面。MiniMax 尚未公开 M3 + H3 或 Speech + H3 的端到端 API 或产品形态,实际效果需要等产品落地后验证。但这种"看、听、说、想"一体化的产品布局,代表了 AI 内容生产的发展方向。
十二、局限性与风险
H3 是一个让人兴奋的产品,但兴奋不应该掩盖审慎。这一章不是要泼冷水,而是要帮你建立正确的预期——知道它在哪里强大,才能更好地规避它在哪里脆弱。
12.1 透明度:最大的不确定性
在所有关于 H3 的讨论中,有一个问题始终悬而未决:我们对这个模型了解得太少了。
参数量未公开。这意味着我们不知道 H3 是百亿参数级别的轻量模型,还是千亿参数级别的重量级模型。参数量直接决定了本地部署的可行性、推理成本的下限、以及模型能力的理论上限。在没有这个数据的情况下,任何关于"H3 能不能在我的 GPU 上跑"的判断都是猜测。
训练数据的来源和构成同样是个黑箱。官方宣称"完全基于真实、自然数据",这是一个有策略性的表述——"真实"和"自然"暗示了数据质量高、没有过度依赖合成数据,但它回避了更关键的问题:这些数据是怎么来的?有多少是经过授权的?网页抓取的比例有多大?涉及哪些语言和地域?训练数据的合规性在版权诉讼频发的当下,不是一个学术问题,而是直接影响商业可用性的法律风险。
技术报告的缺失则意味着我们无法独立验证官方的技术声明。"H3-VAE 将有效序列长度提高了四倍"、"异构训练架构使训练吞吐提升了 30%"——这些数字听起来很有说服力,但没有消融实验和对比基线,我们无法判断它们的测量条件和适用范围。
综合判断:H3 可以被判断为一个竞争力很强、成本合理的商业 API,但尚不能判断它是否会成为真正易部署、可微调、许可证友好的开放权重基础模型。 建议持续关注 MiniMax 的后续信息披露,特别是权重开放时间表、许可证条款和技术报告。
12.2 能力边界:15 秒之外的世界
H3 在 15 秒以内的短视频领域表现出色,但一旦超出这个范围,问题就开始显现。
长程叙事的一致性未被验证。 15 秒足以容纳一个完整的短叙事结构,但它无法覆盖电影级的长镜头、完整的产品介绍、或连续的剧情发展。通过 Extend Video 可以延长到约 30 秒,但每段延长都需要一次新的生成任务,跨段的角色一致性、风格一致性和叙事连贯性只能通过参考素材来间接维持——这种"间接维持"的效果,还没有被系统性地测试和量化。
复杂物理交互的可靠性有限。 第 6.6 节已经详细列举了高风险场景,这里不再重复清单,而是想强调一个更深层的问题:当前所有视频生成模型对物理世界的理解都是统计性的,而非因果性的。模型知道"人走路时手臂通常会摆动",但它不理解重力、摩擦力和惯性。这意味着在涉及精确物理交互的场景中(如球的弹跳轨迹、液体的流动、机械的传动),H3 的输出可能看起来"差不多对",但在专业人士眼中会暴露明显的物理错误。
生成速度的不确定性。 当前 H3 的真实生成延迟、实时因子和并发吞吐均未公开。Artificial Analysis 提供了价格和质量排名,但没有足以代表 MiniMax 官方后端的稳定端到端延迟数据。对于需要按时交付的商业项目来说,生成速度的不确定性是一个实际风险——你可能需要在高峰期等待更长时间,或者在并发请求较多时遇到排队。
12.3 版权与法律:真实的诉讼,真实的后果
这不是理论上的风险。Hailuo 平台目前正面临迪士尼(Disney)、环球影业(Universal)和华纳兄弟(Warner Bros.)等主要版权方提起的诉讼[4]。这些诉讼指控的核心是:Hailuo 使用受版权保护的内容进行训练,并且能够生成知名角色(如迪士尼动画人物)的形象,涉嫌侵犯版权。
2025 年提起的诉讼在 2026 年 5 月经历了初步裁定,法院未驳回原告的主要主张。这意味着案件将进入实质审理阶段,最终结果尚不确定。需要注意的是,类似的风险并非 MiniMax 独有——Seedance 也曾因版权方压力承诺强化内容防护,Sora 同样面临来自好莱坞的版权质疑。这是整个 AI 视频生成行业的结构性问题。
对于使用者来说,这意味着几件具体的事:
不要用 H3 生成知名角色或品牌内容。 即使模型技术上可以做到(比如生成一个看起来像米老鼠的角色),法律后果可能非常严重。版权方的诉讼策略通常是同时起诉模型提供方和使用者。
保存完整的审计记录。 如果你使用 H3 生成的视频用于商业用途,建议保存输入素材的原始文件、完整的提示词文本、生成时间和任务 ID、以及人工审核记录。这些记录在潜在的版权纠纷中可以作为"合理使用"或"独立创作"的证据。
关注中国的内容标识法规。 中国《人工智能生成合成内容标识办法》已于 2025 年 9 月实施,要求 AI 生成的文本、图片、音频和视频同时使用显式标识(如水印标签)和隐式标识(如数字水印)。H3 的具体合规方案尚未公开,但使用 H3 生成内容用于公开发布时,使用者自身有义务确保合规。
12.4 安全与伦理:未被回答的问题
H3 的多参考视频、动作迁移和音频条件能力,客观上降低了制作深度伪造内容的门槛。你可以用一张照片 + 一段视频 + 一段音频,让一个不存在的"人"以指定的方式说指定的话。这种能力在创意领域有巨大价值,但在恶意使用场景中同样危险。
官方发布材料中,尚未提供以下关键的安全信息:
- 身份验证机制(如何防止使用他人肖像)
- 未成年人保护策略
- 公众人物的限制措施
- 偏见测试结果
- 红队测试结果
- 提示词拦截率和误杀率
截至检索时,也未找到 H3 使用 C2PA、SynthID 类内容凭证或稳健隐式水印的明确说明。Hailuo 产品界面可显示 AI 生成提示[10],但界面标签不等于文件中存在可机器验证、抗裁剪和抗转码的溯源信息。
这些问题的存在,不意味着 H3 不应该被使用,但意味着在涉及真人肖像、声音克隆、公众人物或知名品牌素材的项目中,应该格外谨慎,并建立完善的人工审核流程。
十三、选型建议矩阵
经过前面十二章的详细分析,这一章把所有信息浓缩成一张可操作的决策表。无论你是内容创作者、技术决策者还是企业采购,都能在这里找到对应的建议。
13.1 按使用场景选模型
| 使用场景 | 首选模型 | 次选模型 | 理由 |
|---|---|---|---|
| 高性价比商业短片、广告电商 | MiniMax H3 | Seedance 2.0 | H3 的 2K + 编辑 + 价格组合最强 |
| 灵活多参考、音乐驱动、多镜头叙事 | Seedance 2.0 | MiniMax H3 | Seedance 参考驱动和运动流畅度更强 |
| 超长时长(30s+)、重度参考(50 级文件) | Seedance 2.5 | — | 单次 30 秒 + 多轮延长至数分钟 |
| 多语言口型、多角色一致性 | HappyHorse 1.1 | H3 | 约 7 种语言口型同步,9 主体锁定 |
| 本地部署、开源定制、研究/二次开发 | Wan 2.7 | — | Apache 2.0,可自由部署微调 |
| 4K 分辨率、多语言对白、元素绑定 | Kling 3.0 | Veo 3.1 | 原生 4K + 5 种语言对白 |
| 极致写实、物理真实感、高保真音频 | Veo 3.1 | — | 48kHz 对白,物理感行业标杆 |
| 已有视频的编辑与重构 | MiniMax H3 | — | 编辑 Elo 第一(1130),领先幅度最大 |
| 草稿阶段、高量迭代、快速筛选 | Seedance 2.0 Mini | Wan 2.7 本地 | 速度快、成本低 |
| 实时直播、互动数字人 | 不适用 | 专用实时模型 | 所有当前模型都不适合 |
| 本地化出海广告(多语言口播) | HappyHorse 1.1 | Kling 3.0 | 口型同步最自然 |
13.2 推荐工作流组合
在实际生产中,很少有团队只用一个模型完成所有工作。以下是几种经过验证的组合工作流:
广告/电商团队:
- 草稿阶段:Seedance 2.0 Mini 或 Wan 本地 → 快速生成大量变体
- 精细控制与最终成片:H3 → 多参考锁定品牌一致性,指令式编辑微调
- 需要 4K 交付时:Kling 3.0 → 最终高分辨率输出
短剧/叙事内容团队:
- 分镜与短镜头:H3 → 15 秒内多镜头叙事
- 长镜头或连续剧情:Seedance 2.5 → 30 秒 + 延长
- 多语言版本:HappyHorse 1.1 → 口型同步本地化
品牌/创意机构:
- 概念提案:H3 → 快速生成 3–5 个视觉方案供客户选择
- 正式制作:根据客户反馈选择 H3(性价比)或 Kling(4K)或 Veo(写实)
- 迭代修改:H3 指令式编辑 → 像与剪辑师聊天一样逐条修改
研究/二次开发团队:
- 基础模型:Wan 2.7 本地部署 → 自由微调和实验
- 商用对标:H3 API → 作为性能基准和商业对照
- 开源后:H3 权重 → 如果如期开放,切换到 H3 的本地部署
13.3 决策流程图
!Model selection decision flow
图 26:选型决策流程(Realtime → 时长 → 4K → 本地 → 口型 → H3)。
如果你还在犹豫选哪个模型,可以按以下流程快速判断:
- 你需要实时生成吗? → 是 → 不适合 H3,考虑专用实时模型
- 你需要超过 30 秒的视频吗? → 是 → Seedance 2.5
- 你需要 4K 分辨率吗? → 是 → Kling 3.0 或 Veo 3.1
- 你需要本地部署吗? → 是 → Wan 2.7(现在)或 H3(等权重开放)
- 你需要多语言口型同步吗? → 是 → HappyHorse 1.1
- 你需要大量参考素材的组合编辑吗? → 是 → MiniMax H3
- 你需要极致写实和物理真实感吗? → 是 → Veo 3.1
- 你需要快速出活、成本敏感吗? → 是 → MiniMax H3
- 你还没想好? → 先试 H3,它是当前综合性价比最高的起点
十四、总结与展望
14.1 H3 的核心价值
回顾全文,H3 的核心价值可以浓缩为四点:
图 27:H3 四点核心价值(Unified Multimodal / Native A/V / Price / Open Path)。
统一多模态接口。 H3 不是把文生视频、图生视频、视频编辑和音频生成当作四个独立任务,而是将文本、图像、视频和音频放入同一上下文中统一理解。这种"全能参考"能力在当前商业视频模型中独树一帜,让用户可以用最自然的方式——混合多种素材加一段文字描述——来表达创意意图。
原生音画同步。 双声道立体声与画面同一次推理生成,省去了单独配音、混音和音画对齐的后期步骤。对于短视频工作流来说,这是一个从"默片时代"到"有声时代"的质变。
极致性价比。 2K 分辨率每秒约 0.8 元人民币,不到主流竞品的三分之一。这让中小团队和个人创作者也能负担得起高质量 AI 视频生成的成本。
即将开源。 如果 MiniMax 兑现开放权重的承诺,H3 将成为当前性能最强的开放权重视频生成模型之一,直接改变行业的竞争格局。
14.2 最大的不确定性
但 H3 同样面临几个尚未解答的关键问题:
- 透明度: 参数量、训练数据规模、完整技术报告均未披露,我们无法独立验证官方的技术声明。
- 许可证: 权重尚未实际交付,许可证条款和硬件需求未知。
- 安全: 内容安全评测结果、身份验证机制、内容标识方案均未公开。
- 版权: Disney 等权利方的诉讼仍在进行中,最终结果将影响 H3 的商业可用性。
14.3 展望
H3 的发布标志着 AI 视频生成从"单一模态工具"向"多模态内容制作引擎"的范式转变。但这个转变才刚刚开始。
短期来看(未来 3–6 个月),最值得关注的事件是 H3 权重的实际开放、许可证条款的公布、以及 Seedance 2.5、Kling 3.1 等竞品的后续回应。AI 视频生成领域的竞争节奏极快,H3 的领先优势可能只能维持几个月。
中期来看(未来 1–2 年),AI 视频生成模型的能力边界将持续扩展:更长的时长(从 15 秒到分钟级)、更高的分辨率(从 2K 到 4K 到 8K)、更精细的物理模拟、更可靠的长程一致性。这些进步将逐步消除当前的技术局限,让 AI 视频生成从"短视频工具"升级为"全流程内容生产引擎"。
长期来看(3–5 年),AI 视频生成将与语言模型、语音模型、3D 模型深度融合,形成真正的多模态通用智能。MiniMax 的 M3 + H3 + Speech 产品矩阵,正是朝着这个方向迈出的第一步。
对于当下的使用者来说,最重要的一点是:不要等待"完美的模型"。 H3 已经足够好,可以在大量商业场景中创造真实价值。但它也有明确的能力边界和风险点,需要在使用中保持清醒的认知。最好的策略是:先用起来,积累经验,持续迭代——正如 H3 本身一样。
> 下一步: 规格与榜单只能帮你缩小选择面;是否适合你的工作流,还是要用自己的素材试一次。打开 minimaxh3.art 提交文生或图生任务,直接验证音画同步、文字渲染和迭代节奏。
参考资料
本文信息综合自以下渠道,按权威性排序。文中涉及的技术规格、架构描述和功能说明以官方来源为准;Elo 排名和盲测数据来自第三方独立评测;价格信息以各平台实时页面为准。
官方来源
- MiniMax 官方博客 — H3 发布公告、技术架构介绍(Contextual Omni Representation、H3-VAE、H3-Omni Transformer、In-Context Regeneration)
- 来源:<https://www.minimax.io/blog/minimax-h3>
- 抓取时间:2026-07-31
- MiniMax 开放平台 API 文档 — 模型 ID、请求参数、异步任务机制、文件格式与大小限制
- 来源:MiniMax 开放平台(api.minimax.chat)
第三方独立评测
- Artificial Analysis — 带音频盲测 Elo 排名(T2V / I2V / 编辑)、价格与质量排名
- 说明:Elo 分数衡量用户主观偏好,非物理准确率或逐帧重建质量
- 来源:<https://artificialanalysis.ai>
行业分析与深度解读
- OrcaRouter 深度解析 — 作者:Jinhao Song(2026-07-30),公司背景(IPO、估值、投资方)、Hailuo 迭代路径、M3 同期发布、2026 年竞争格局分析、Sora 终止时间线
- 来源:<https://www.orcarouter.ai/blog/minimax-h3-hailuo-3-explained>
- Kie.ai 完整指南 — 作者:Lukas Vogel(2026-07-30),早期规格确认、定价估算($1/15s 2K)、与 Seedance 2.0 价格对比、社区反馈汇总
- 来源:<https://kie.ai/blog/what-is-hailuo-h3>
- DeeVid 评测文章 — H3 五大升级亮点、与 Hailuo 02 对比、适用场景分析、可能的不足(长序列一致性、对白可靠性、文字渲染)、提示词写作建议
- 来源:<https://deevid.ai/blog/minimax-h3-review>
中文媒体
- 科创板日报 — H3 发布新闻确认(2026-07-31),定位为"通用全模态生成模型"
- 来源:<https://www.cls.cn/detail/2442143>
第三方平台与 API 接入
- EvoLink — H3 API 接入页面,定价详情($0.130/秒)、三个模型 ID、参考素材输入限制、费用示例、测试预算参考
- 来源:<https://evolink.ai/zh/hailuo-3>
- Atlas Cloud — H3 API 页面,三大 API 模态详解、核心特性(12 参考文件、原生立体声、提示词级编辑、声音迁移)、横向对比表
- 来源:<https://www.atlascloud.ai/zh/models/minimax-h3>
- OpenArt — H3 介绍页,Key Features、适用场景、使用技巧、OpenArt Characters 集成
- 来源:<https://openart.ai/ai-model/minimax-h3/>
社区案例
- X(Twitter)创作者案例 — 发布首日社区使用案例,涵盖品牌片头、产品广告、多模态参考、电影感叙事、动漫等场景
- 来源:详见第 10.8 节各案例链接



