30:00:00

10 créditos no cadastro · 20% OFF anual

Ver ofertas anuais
Tutorials

Como Usar o MiniMax H3: Um Guia Passo a Passo para Criar Vídeos em 2K com IA

M

AI video generation & studio workflow guides.

15 min read
Como Usar o MiniMax H3: Um Guia Passo a Passo para Criar Vídeos em 2K com IA

O MiniMax H3 está no ar. Você já leu as especificações, já viu as demonstrações e quer experimentar por conta própria. Este guia o conduz por todo o…

O MiniMax H3 está no ar. Você já leu as especificações, já viu as demonstrações e quer experimentar por conta própria. Este guia o conduz por todo o processo — desde a escolha da plataforma até a escrita do seu primeiro prompt e a iteração sobre o resultado — para que você possa ir do zero a um vídeo utilizável em 2K com áudio sincronizado da forma mais eficiente possível.

Nenhuma experiência prévia com geração de vídeo por IA é presumida. Se você já usou outros modelos antes, pule para as seções mais relevantes; o H3 tem recursos únicos suficientes (Omni-Reference, edição baseada em instruções) para que até mesmo usuários experientes encontrem território novo aqui.


Passo 1: Escolha Seu Ponto de Entrada

O H3 é acessível através de vários canais. O certo depende de se você quer uma interface visual para testes rápidos ou uma API para integração em um fluxo de trabalho de produção.

Opção A: Site Oficial do Hailuo (hailuoai.video)

Este é o caminho mais simples. Cadastre-se em hailuoai.video, selecione o H3 no menu de modelos e comece a gerar através de uma interface baseada em navegador. Nenhuma codificação necessária. Nenhuma chave de API para gerenciar.

Ideal para: criadores individuais, testadores iniciantes, qualquer pessoa que queira avaliar a qualidade de saída do H3 antes de se comprometer com uma integração de API. Você também pode encontrar exemplos selecionados, dicas e as últimas notícias do H3 em minimaxh3.art.

Para desenvolvedores construindo produtos ou fluxos de trabalho automatizados, a EvoLink fornece uma interface programática com três IDs de modelo com base no seu tipo de entrada:

ID do ModeloQuando Usar
minimax-h3-text-to-videoVocê está gerando apenas a partir de um prompt de texto
minimax-h3-image-to-videoVocê tem um primeiro frame, último frame, ou ambos para ancorar a geração
minimax-h3-reference-to-videoVocê deseja fornecer referências multimodais (imagens + vídeo + áudio) para controle máximo

A API é assíncrona: você envia uma tarefa, recebe um ID de tarefa, faz polling de status e baixa o MP4 resultante quando concluído. Não há endpoint de cancelamento — se uma tarefa falhar, você recebe um reembolso total.

Uma solicitação básica se parece com isto:

``json { "model": "minimax-h3-text-to-video", "prompt": "A lone traveler walks along a windswept cliff at golden hour, cinematic tracking shot", "duration": 5, "quality": "2k", "aspect_ratio": "16:9" } ``

Preço: ~$0.13 por segundo de saída em 2K. Um clipe de 5 segundos custa ~$0.65; um clipe de 15 segundos ~$1.95. Imagens e áudio de referência são gratuitos; clipes de vídeo de referência adicionam sua duração ao tempo faturável.

Opção C: Plataformas de Terceiros

OpenArt, Atlas Cloud e outros provedores de inferência oferecem o H3 através de suas próprias interfaces, geralmente com compatibilidade de API unificada e preços por uso. Estas podem ser convenientes se você já possui contas nessas plataformas e deseja comparar o MiniMax H3 com outros modelos no mesmo ambiente.


Passo 2: Escreva um Prompt Forte

O prompt é a entrada mais importante que você fornece. O H3 segue suas instruções de perto, o que significa que prompts vagos produzem resultados vagos, e prompts específicos produzem resultados específicos. A diferença entre uma geração medíocre e uma excelente frequentemente se resume à qualidade do prompt.

A Estrutura Recomendada

Pense no seu prompt como um briefing compacto de produção. Os prompts mais eficazes seguem esta sequência:

Sujeito → Cena → Ação → Câmera → Timing → Estilo Visual → Áudio

Você não precisa incluir todos os elementos em todos os prompts. Mas cobrir os principais dá ao modelo material suficiente para trabalhar, e a ordem ajuda a entender o que é mais importante.

Exemplo 1: Anúncio de Produto

`` A luxury silver watch rests on a dark stone pedestal inside a modern gallery. The camera slowly pushes forward as a beam of light moves across the metal surface. Fine dust floats in the air. Premium cinematic commercial style, controlled movement, high contrast lighting, subtle mechanical ticking and deep ambient sound. ``

Observe como este prompt cobre todos os sete elementos:

  • Sujeito: relógio de prata de luxo
  • Cena: pedestal de pedra escura, galeria moderna
  • Ação: feixe de luz se move pela superfície
  • Câmera: avança lentamente
  • Estilo visual: comercial cinematográfico premium, alto contraste
  • Áudio: tiquetaque mecânico, som ambiente profundo

Exemplo 2: Cena Narrativa

`` A young woman enters a quiet cafe during heavy rain. She closes her umbrella, looks toward the counter and notices an old friend. Begin with a wide exterior shot, cut to a medium tracking shot as she enters, then finish on a close-up of her surprised expression. Natural dialogue ambience, rain against the windows and soft piano music. ``

Este prompt demonstra narrativa multi-batimento: descreve uma sequência de eventos ao longo do tempo, especifica três tomadas distintas com direções de câmera explícitas e define tanto as camadas de áudio ambiente quanto musical.

Exemplo 3: Cena de Ação

`` First-person POV, eye level, handheld game footage. A player holding an assault rifle advances slowly along the perimeter of a modern military base. The crosshair scans the corridor ahead; after a brief pause, the player fires several rounds at a distant target point, then continues forward. Cold natural lighting mixed with smoke and muzzle flash. Subtle handheld sway with small lateral glances, minor recoil vibration when firing, then steady forward movement. ``

Este prompt mostra como especificar perspectiva (primeira pessoa POV), comportamento físico (recuo, balanço) e atmosfera (luz fria, fumaça, clarão do disparo) para conteúdo de alta intensidade.

Reglas de Prompting Que Realmente Importam

Com base em testes iniciais de usuários e documentação da plataforma, estas diretrizes fazem a diferença mais consistente:

  1. Escreva movimentos de câmera em linguagem profissional de tomada. "Slow orbit to the right" funciona melhor que "camera moves around." "Handheld tracking shot" funciona melhor que "following the character." O H3 segue vocabulário cinematográfico — use-o.
  1. Descreva eventos em ordem cronológica. O modelo interpreta seu prompt como uma linha do tempo. Se você descrever o final antes do início, ele pode reordenar as tomadas.
  1. Limite o número de ações principais. Um clipe de 15 segundos pode suportar 2–3 ações distintas ou batimentos narrativos. Tentar encaixar seis eventos em 15 segundos produz saída confusa.
  1. Separe instruções visuais de instruções de áudio. Coloque sua descrição visual primeiro e depois adicione pistas de áudio no final. Isso ajuda o modelo a analisar quais instruções se aplicam a qual canal de saída.
  1. Nomeie o que deve permanecer consistente. Se a aparência de um personagem, a identidade visual de um produto ou um elemento de fundo deve permanecer estável entre tomadas, diga-o explicitamente.
  1. Não preencha cada segundo com um novo evento. O H3 lida com ritmo e pausas. Deixar espaço para momentos de imobilidade produz resultados mais naturais do que uma lista de ações segundo a segundo.

Passo 3: Use o Omni-Reference para Controle Máximo

O Omni-Reference é o recurso emblemático do H3, e é onde o modelo se separa da concorrência. Aqui está como usá-lo de forma eficaz.

O Que Você Pode Enviar

Tipo de ReferênciaMáximoLimites de DuraçãoTamanho do Arquivo
ImagensAté 930 MB cada
Clipes de vídeoAté 32–15 segundos cada; 15 segundos totais por tipo50 MB cada
Clipes de áudioAté 32–15 segundos cada; 15 segundos totais por tipo15 MB cada
Total de arquivos12Limite de 64 MB no corpo da solicitação

Restrições-chave:

  • O áudio não pode ser enviado sozinho — deve ser combinado com pelo menos uma imagem ou vídeo.
  • A duração do vídeo de referência é adicionada ao seu tempo de saída faturável; imagens e áudio de referência não.
  • Formatos suportados: JPG, PNG, WEBP, HEIC, HEIF (imagens); H.264, H.265 (vídeo); WAV, MP3 (áudio).

Como Preparar Imagens de Referência

A qualidade das suas imagens de referência determina diretamente a qualidade da consistência do personagem. Siga estas diretrizes:

  • Iluminação uniforme. Evite sombras duras, contraluz forte ou temperaturas de cor misturadas. Um rosto bem iluminado com sombras mínimas fornece ao modelo os dados mais utilizáveis.
  • Ângulo frontal direto. Fotos frontais ou quase frontais funcionam melhor. Tomadas de perfil, ângulos de três quartos e cabeças inclinadas reduzem a capacidade do modelo de fixar a identidade.
  • Sem obstruções. Chapéus, óculos de sol, cabelo cobrindo o rosto, mãos cobrindo características — tudo isso reduz a eficácia da referência.
  • Fundo limpo. Um fundo simples e desimpedido ajuda o modelo a separar o sujeito do ambiente.
  • Múltiplos ângulos se possível. Se você tem vários slots de referência disponíveis, use-os: um frontal, um leve ângulo, um corpo inteiro. Isso dá ao modelo uma imagem mais completa.

Como Preparar Referências de Áudio

Referências de áudio fixam a voz de um personagem. Os mesmos princípios de qualidade se aplicam:

  • Use uma gravação limpa com mínimo ruído de fundo.
  • 2–15 segundos de fala clara são suficientes.
  • Tom vocal consistente (sem transições de sussurro para grito dentro do clipe).
  • Se você está mirando um sotaque ou padrão de fala específico, a referência deve demonstrá-lo.

Quando Usar Omni-Reference vs. Texto-para-Vídeo

CenárioModo Recomendado
Teste de conceito rápido, sem personagem específico necessárioTexto-para-vídeo
Animação de produto a partir de uma fotoImagem-para-vídeo (primeiro frame)
Personagem deve parecer e soar específico entre tomadasOmni-reference
Transferência de estilo a partir de imagens existentesOmni-reference (clipe de vídeo)
Criativo de anúncio com mascote de marcaOmni-reference (imagens + áudio)
Videoclipe com performer consistenteOmni-reference (imagens + vídeo + áudio)

Passo 4: Gere, Revise e Itere

Configurando Sua Geração

Antes de clicar em gerar, configure estes parâmetros:

  • Duração: Comece com 5 segundos para testes. Quando estiver satisfeito com o prompt e as referências, estenda para 10 ou 15 segundos.
  • Proporção de tela: Combine com sua plataforma de destino. 9:16 para TikTok/Reels/Shorts. 16:9 para YouTube e uso geral. 1:1 para feed do Instagram. 21:9 para widescreen cinematográfico.
  • Qualidade: 2K é a única opção no lançamento — esta é a configuração padrão e recomendada.

O Que Avaliar em Sua Primeira Geração

Não assista à saída apenas uma vez e siga em frente. Avalie sistematicamente:

  1. Aderência ao prompt. O modelo seguiu suas instruções de sujeito, cena, ação e câmera? Se não, quais elementos foram ignorados ou mal interpretados?
  2. Consistência do personagem. (Se usando referências) O personagem combina com as imagens de referência? As características faciais, roupas e proporções estão estáveis entre tomadas?
  3. Qualidade do áudio. Os diálogos são inteligíveis? Os efeitos sonoros chegam nos momentos certos? A atmosfera ambiente é apropriada?
  4. Qualidade do movimento. Os movimentos são naturais? Há deformação, cintilação ou inconsistência temporal?
  5. Composição geral. O enquadramento funciona? A iluminação é consistente? O ritmo parece correto?

Iterando com Edição Baseada em Instruções

Aqui é onde a vantagem de fluxo de trabalho do H3 se torna clara. Quando sua geração está 85–90% correta e um elemento precisa de correção, não regenere do zero. Use a edição baseada em instruções.

Envie uma instrução de acompanhamento descrevendo apenas a mudança desejada:

  • "Mude a cor da jaqueta para azul marinho."
  • "Substitua o fundo por uma praia ao pôr do sol."
  • "Torne o movimento de câmera mais lento na primeira metade."
  • "Mude a expressão do personagem para mais surpresa."

O modelo aplica a edição à geração existente enquanto preserva o enquadramento, a iluminação, a performance e o caminho da câmera. Isso é dramaticamente mais eficiente do que regenerar — você mantém o que funciona e corrige o que não funciona.

Dica profissional: Se sua primeira instrução de edição não produzir o resultado desejado, tente reformulá-la com mais especificidade. "Mude o fundo" é vago. "Substitua o fundo por uma parede de estúdio branca com iluminação direcional suave vinda do canto superior esquerdo" é específico o suficiente para o modelo agir.

Quando Regenerar em Vez de Editar

A edição baseada em instruções é poderosa, mas nem sempre é a escolha certa:

  • Saída fundamentalmente errada (sujeito errado, cena completamente errada, movimento incoerente): regenere com um prompt revisado.
  • Múltiplos problemas interconectados (se corrigir uma coisa exigir mudanças em cascata): regenerar pode ser mais limpo do que empilhar múltiplas instruções de edição.
  • Desejar uma direção criativa fresca: às vezes a melhor jogada é tentar um prompt completamente diferente em vez de forçar edições em uma geração que está indo na direção errada.

Passo 5: Exporte e Integre

Baixando Seu Vídeo

Os vídeos gerados são entregues como arquivos MP4. Na interface web do Hailuo, clique no botão de download quando a geração estiver concluída. Via API, a resposta da tarefa concluída contém uma URL de download.

Importante: Os links de vídeo expiram 24 horas após a geração. Baixe e salve seus arquivos prontamente. Se você está construindo um pipeline automatizado, implemente uma etapa que busca e armazena o MP4 no seu próprio armazenamento imediatamente após a conclusão da tarefa.

Integração de Pós-Produção

Para a maioria dos casos de uso, o vídeo gerado precisará de alguns toques finais antes de estar pronto para entrega final:

  • Elementos de marca. Adicione logotipos, marcas d'água e sobreposições de texto específicas da marca no seu editor de vídeo. O H3 lida bem com cenas visuais, mas tipografia precisa e posicionamento de logotipo ainda são mais seguros na pós-produção.
  • Correção de cor. Se sua marca tem uma paleta de cores ou visual específico, aplique uma correção de cor na pós-produção para alinhar o vídeo gerado com sua identidade visual.
  • Mixagem de áudio. Embora o H3 gere áudio sincronizado, você pode querer ajustar níveis, adicionar uma camada de música ou substituir o diálogo por uma voz profissional para entrega final.
  • Formatação para plataforma. Exporte no codec, bitrate e formato de contêiner exigidos pela sua plataforma de destino (H.264 MP4 para a maioria das plataformas sociais, ProRes para broadcast, etc.).

Modelos de Prompt Que Você Pode Usar Agora

Copie, personalize e gere. Estes modelos são estruturados para máxima eficácia com o H3.

Modelo A: Tomada Cinematográfica de Produto

`` A [product] rests on [surface] inside [environment]. The camera [movement description] as [lighting effect]. [Atmospheric detail]. [Visual style] commercial aesthetic, [lighting quality]. [Audio: ambient sound + subtle effect]. ``

Exemplo: `` A matte black perfume bottle rests on a white marble slab inside a dimly lit studio. The camera slowly orbits to the right as a single spotlight sweeps across the glass surface. Fine mist particles float in the air. Minimalist luxury commercial aesthetic, dramatic directional lighting. Soft ambient hum and gentle glass resonance. ``

Modelo B: Narrativa Orientada por Personagem

`` [Character description] [action sequence in chronological order]. Begin with [opening shot], [transition shot], then finish on [closing shot]. [Dialogue or vocal quality]. [Ambient sounds] + [background music]. ``

Exemplo: `` A middle-aged man in a worn leather jacket sits alone at a rain-streaked window in a dimly lit diner. He stares at an old photograph, then slowly folds it and puts it in his pocket. Begin with a wide shot of the empty diner, cut to a medium close-up of his hands holding the photo, then finish on a tight close-up of his weathered face. Quiet, gravelly breathing. Rain against glass, distant highway traffic, muted jukebox playing a slow blues track. ``

Modelo C: Gancho para Redes Sociais

`` Quick [opening action] reveals [subject] in [setting]. Camera [dynamic movement]. [Second action/beat]. [Third action/beat with visual payoff]. [Style] aesthetic, [vibrant/moody/energetic] mood. [Punchy audio: beat drop / sound effect / music style]. ``

Exemplo: `` Quick hand swipe reveals a pair of glowing neon sneakers floating in a dark warehouse. Camera dollies forward rapidly. The sneakers drop and land on a reflective wet floor, sending sparks outward. Urban streetwear aesthetic, high-energy mood. Heavy bass beat drop on impact, electronic hum, echo reverb. ``

Modelo D: Pré-Visualização / Storyboard

`` [Scene description] with [key elements]. Camera: [specific shot instruction]. Lighting: [lighting description]. Mood: [emotional tone]. Style: [reference style]. Pre-viz storyboard shot, cinematic quality. [Audio mood]. ``

Exemplo: `` A crowded Tokyo street at night with neon signs, umbrella-carrying pedestrians, and a wet asphalt road. Camera: handheld following shot behind a young woman walking briskly through the crowd. Lighting: warm neon glow with cold blue reflections on wet ground. Mood: tense, anticipatory. Style: Blade Runner-inspired neo-noir. Pre-viz storyboard shot, cinematic quality. Muffled crowd noise, rain footsteps, distant electronic music. ``


Erros Comuns e Como Evitá-los

ErroPor Que AconteceSolução
Personagem parece diferente em cada tomadaNenhuma imagem de referência usada, ou referências são de baixa qualidadeEnvie imagens de referência limpas, com iluminação uniforme e ângulo frontal
Áudio não corresponde aos visuaisInstruções visuais e de áudio estão misturadas no promptSepare a descrição visual da descrição de áudio; coloque pistas de áudio no final
Movimentos de câmera parecem aleatóriosO prompt descreve a cena mas não a câmeraSempre especifique o movimento da câmera explicitamente usando linguagem profissional de tomada
Muitas coisas acontecendo em 15 segundosO prompt tenta encaixar uma história inteira em uma geraçãoLimite a 2–3 ações por geração; use múltiplas gerações para histórias mais longas
Instrução de edição mudou demais ou de menosA instrução de edição estava muito vaga ou muito amplaSeja específico sobre o que muda e o que fica; uma mudança clara por instrução
Link do vídeo expirou antes do downloadEsqueceu da expiração de 24 horasBaixe imediatamente após a geração; automatize o armazenamento em pipelines de API

Cartão de Referência Rápida

ParâmetroOpçõesRecomendação
Duração5–15 segundosComece com 5s para testes, estenda para 15s para produção
Proporção de tela21:9, 16:9, 4:3, 1:1, 3:4, 9:16Combine com sua plataforma de destino
Qualidade2KPadrão — nenhuma outra opção no lançamento
Imagens de referência0–9Use 2–5 para melhor consistência de personagem
Vídeo de referência0–3Use 1–2 para transferência de movimento/estilo
Áudio de referência0–3Use 1 para fixação de voz (requer imagem ou vídeo)
Comprimento do promptChinês: ≤500 caracteres; Inglês: ≤1000 palavrasConciso mas específico

参考资料

  • OpenArt Tutorial: https://openart.ai/ai-model/minimax-h3/
  • EvoLink API Guide: https://evolink.ai/zh/hailuo-3
  • DeeVid Prompting Tips: https://deevid.ai/blog/minimax-h3-review
  • Atlas Cloud Guide: https://www.atlascloud.ai/zh/models/minimax-h3
  • OrcaRouter Explained: https://www.orcarouter.ai/blog/minimax-h3-hailuo-3-explained

Related articles