30:00:00

10 crédits offerts à l’inscription · -20 % à l’annuel

Voir les offres annuelles
Tutorials

Comment utiliser MiniMax H3 : Guide pas à pas pour créer des vidéos IA en 2K

M

AI video generation & studio workflow guides.

16 min read
Comment utiliser MiniMax H3 : Guide pas à pas pour créer des vidéos IA en 2K

MiniMax H3 est désormais en ligne. Vous avez lu les spécifications, vu les démonstrations, et vous avez envie d'essayer par vous-même. Ce guide vous…

MiniMax H3 est désormais en ligne. Vous avez lu les spécifications, vu les démonstrations, et vous avez envie d'essayer par vous-même. Ce guide vous accompagne tout au long du processus — depuis le choix de votre plateforme jusqu'à la rédaction de votre premier prompt (invite de commande), en passant par l'itération sur les résultats — afin de passer de zéro à une vidéo 2K exploitable avec audio synchronisé, aussi efficacement que possible.

Aucune expérience préalable en génération vidéo par IA n'est requise. Si vous avez déjà utilisé d'autres modèles, passez directement aux sections les plus pertinentes pour vous ; H3 dispose de suffisamment de fonctionnalités uniques (Omni-Reference, édition par instruction) pour que même les utilisateurs expérimentés y découvrent de nouveaux territoires.


Étape 1 : Choisissez votre point d'entrée

H3 est accessible via plusieurs canaux. Le bon choix dépend de votre besoin : une interface visuelle pour des tests rapides, ou une API (interface de programmation) pour l'intégration dans un flux de travail de production.

Option A : Site officiel Hailuo (hailuoai.video)

C'est le chemin le plus simple. Inscrivez-vous sur hailuoai.video, sélectionnez H3 dans le menu des modèles, et commencez à générer via une interface dans le navigateur. Aucun code requis. Aucune clé API à gérer.

Idéal pour : les créateurs individuels, les testeurs débutants, toute personne souhaitant évaluer la qualité de sortie de H3 avant de s'engager dans une intégration API. Vous pouvez également trouver des exemples sélectionnés, des astuces et les dernières actualités de H3 sur minimaxh3.art.

Pour les développeurs construisant des produits ou des flux automatisés, EvoLink fournit une interface programmatique avec trois identifiants de modèle selon votre type d'entrée :

Identifiant de modèleÀ utiliser lorsque
minimax-h3-text-to-videoVous générez à partir d'un prompt texte uniquement
minimax-h3-image-to-videoVous disposez d'une première image, d'une dernière image, ou des deux pour ancrer la génération
minimax-h3-reference-to-videoVous souhaitez fournir des références multimodales (images + vidéo + audio) pour un contrôle maximal

L'API est asynchrone : vous soumettez une tâche, recevez un identifiant de tâche, interrogez périodiquement le statut, et téléchargez le fichier MP4 résultant une fois terminé. Il n'existe pas de point d'annulation — si une tâche échoue, vous recevez un remboursement intégral.

Une requête basique ressemble à ceci :

``json { "model": "minimax-h3-text-to-video", "prompt": "A lone traveler walks along a windswept cliff at golden hour, cinematic tracking shot", "duration": 5, "quality": "2k", "aspect_ratio": "16:9" } ``

Tarification : environ 0,13 $ par seconde de sortie en 2K. Un extrait de 5 secondes coûte environ 0,65 $ ; un extrait de 15 secondes environ 1,95 $. Les images et les audio de référence sont gratuits ; les clips vidéo de référence ajoutent leur durée au temps facturable.

Option C : Plateformes tierces

OpenArt, Atlas Cloud et d'autres fournisseurs d'inférence proposent H3 via leurs propres interfaces, souvent avec compatibilité API unifiée et tarification à l'usage. Ces options peuvent être pratiques si vous avez déjà des comptes sur ces plateformes et souhaitez comparer MiniMax H3 avec d'autres modèles dans le même environnement.


Étape 2 : Rédigez un prompt solide

Le prompt est l'entrée la plus importante que vous fournissez. H3 suit vos instructions de près, ce qui signifie que des prompts vagues produisent des résultats vagues, et des prompts précis produisent des résultats précis. La différence entre une génération médiocre et une excellente repose souvent sur la qualité du prompt.

La structure recommandée

Considérez votre prompt comme un brief de production compact. Les prompts les plus efficaces suivent cette séquence :

Sujet → Scène → Action → Caméra → Timing → Style visuel → Audio

Il n'est pas nécessaire d'inclure tous les éléments dans chaque prompt. Mais couvrir les principaux donne au modèle suffisamment de matière à travailler, et l'ordre l'aide à comprendre ce qui compte le plus.

Exemple 1 : Publicité produit

`` A luxury silver watch rests on a dark stone pedestal inside a modern gallery. The camera slowly pushes forward as a beam of light moves across the metal surface. Fine dust floats in the air. Premium cinematic commercial style, controlled movement, high contrast lighting, subtle mechanical ticking and deep ambient sound. ``

Remarquez comment ce prompt couvre les sept éléments :

  • Sujet : montre argentée de luxe
  • Scène : piédestal en pierre sombre, galerie moderne
  • Action : un faisceau lumineux se déplace sur la surface
  • Caméra : lentement en avant
  • Style visuel : publicité cinématographique haut de gamme, fort contraste
  • Audio : tic-tac mécanique, ambiance sonore profonde

Exemple 2 : Scène narrative

`` A young woman enters a quiet cafe during heavy rain. She closes her umbrella, looks toward the counter and notices an old friend. Begin with a wide exterior shot, cut to a medium tracking shot as she enters, then finish on a close-up of her surprised expression. Natural dialogue ambience, rain against the windows and soft piano music. ``

Ce prompt illustre une narration à plusieurs temps : il décrit une séquence d'événements dans le temps, spécifie trois plans distincts avec des indications de caméra explicites, et définit à la fois les couches sonores d'ambiance et de musique.

Exemple 3 : Scène d'action

`` First-person POV, eye level, handheld game footage. A player holding an assault rifle advances slowly along the perimeter of a modern military base. The crosshair scans the corridor ahead; after a brief pause, the player fires several rounds at a distant target point, then continues forward. Cold natural lighting mixed with smoke and muzzle flash. Subtle handheld sway with small lateral glances, minor recoil vibration when firing, then steady forward movement. ``

Ce prompt montre comment spécifier la perspective (POV à la première personne), le comportement physique (recul, balancement) et l'atmosphère (lumière froide, fumée, flash de bouche) pour un contenu à haute intensité.

Règles de rédaction qui comptent vraiment

D'après les tests utilisateurs précoces et la documentation de la plateforme, ces directives font la différence la plus régulière :

  1. Rédigez les mouvements de caméra dans un langage de plan professionnel. « Lent orbite vers la droite » fonctionne mieux que « la caméra tourne autour ». « Plan suivi caméra à l'épaule (handheld tracking shot) » fonctionne mieux que « suivant le personnage ». H3 suit le vocabulaire cinématographique — utilisez-le.
  1. Décrivez les événements dans l'ordre chronologique. Le modèle interprète votre prompt comme une chronologie. Si vous décrivez la fin avant le début, il peut réordonner les plans.
  1. Limitez le nombre d'actions principales. Un extrait de 15 secondes peut supporter 2 à 3 actions distinctes ou temps narratifs. Essayer de caser six événements en 15 secondes produit un résultat confus.
  1. Séparez les instructions visuelles des instructions audio. Placez votre description visuelle en premier, puis ajoutez les repères audio à la fin. Cela aide le modèle à déterminer quelles instructions s'appliquent à quel canal de sortie.
  1. Nommez ce qui doit rester cohérent. Si l'apparence d'un personnage, l'image de marque d'un produit ou un élément d'arrière-plan doit rester stable entre les plans, dites-le explicitement.
  1. Ne remplissez pas chaque seconde d'un nouvel événement. H3 gère le rythme et les pauses. Laisser de la place à des moments de calme produit des résultats plus naturels qu'une liste d'action seconde par seconde.

Étape 3 : Utilisez Omni-Reference pour un contrôle maximal

Omni-Reference est la fonction phare de H3, et c'est là que le modèle se distingue de la concurrence. Voici comment l'utiliser efficacement.

Ce que vous pouvez télécharger

Type de référenceMaximumLimites de duréeTaille de fichier
ImagesJusqu'à 930 Mo chacune
Clips vidéoJusqu'à 32–15 secondes chacun ; 15 secondes au total par type50 Mo chacun
Clips audioJusqu'à 32–15 secondes chacun ; 15 secondes au total par type15 Mo chacun
Total de fichiers12Limite de 64 Mo pour le corps de la requête

Contraintes clés :

  • L'audio ne peut pas être soumis seul — il doit être associé à au moins une image ou vidéo.
  • La durée des vidéos de référence est ajoutée à votre temps de sortie facturable ; les images et les audio de référence ne le sont pas.
  • Formats supportés : JPG, PNG, WEBP, HEIC, HEIF (images) ; H.264, H.265 (vidéo) ; WAV, MP3 (audio).

Comment préparer les images de référence

La qualité de vos images de référence détermine directement la qualité de la cohérence de vos personnages. Suivez ces directives :

  • Éclairage homogène. Évitez les ombres dures, les forts contre-jours ou les températures de couleur mélangées. Un visage bien éclairé avec un minimum d'ombres fournit au modèle les données les plus exploitables.
  • Angle de visage direct. Les photos de face ou quasi de face fonctionnent le mieux. Les profils, les trois-quarts et les têtes inclinées réduisent la capacité du modèle à verrouiller l'identité.
  • Aucune obstruction. Chapeaux, lunettes de soleil, cheveux sur le visage, mains couvrant les traits — tout cela réduit l'efficacité de la référence.
  • Arrière-plan propre. Un arrière-plan simple et épuré aide le modèle à séparer le sujet de l'environnement.
  • Plusieurs angles si possible. Si vous disposez de plusieurs emplacements de référence, utilisez-les : un de face, un légèrement de côté, un en pied. Cela donne au modèle une image plus complète.

Comment préparer les références audio

Les références audio ancrent la voix d'un personnage. Les mêmes principes de qualité s'appliquent :

  • Utilisez un enregistrement propre avec un minimum de bruit de fond.
  • 2 à 15 secondes de parole claire sont suffisantes.
  • Tonalité vocale cohérente (pas de transition du murmure au cri au sein du même clip).
  • Si vous visez un accent ou un schéma de parole spécifique, la référence doit le démontrer.

Quand utiliser Omni-Reference vs. Texte-vidéo

ScénarioMode recommandé
Test de concept rapide, pas de personnage spécifique requisTexte-vidéo (text-to-video)
Animation produit à partir d'une photo de produitImage-vidéo (image-to-video, première image)
Le personnage doit avoir un aspect et une voix précis à travers les plansOmni-reference
Transfert de style à partir de séquences existantesOmni-reference (clip vidéo)
Création publicitaire avec une mascotte de marqueOmni-reference (images + audio)
Clip vidéo avec un interprète cohérentOmni-reference (images + vidéo + audio)

Étape 4 : Générez, examinez et itérez

Configuration de votre génération

Avant de lancer la génération, configurez ces paramètres :

  • Durée : commencez par 5 secondes pour les tests. Une fois satisfait du prompt et des références, passez à 10 ou 15 secondes.
  • Ratio d'aspect (aspect ratio) : adaptez-vous à votre plateforme cible. 9:16 pour TikTok/Reels/Shorts. 16:9 pour YouTube et usage général. 1:1 pour le fil Instagram. 21:9 pour le format cinématique large.
  • Qualité : 2K est la seule option au lancement — c'est le réglage par défaut et recommandé.

Ce qu'il faut évaluer dans votre première génération

Ne vous contentez pas de regarder la sortie une fois avant de passer à autre chose. Évaluez systématiquement :

  1. Respect du prompt. Le modèle a-t-il suivi vos instructions de sujet, de scène, d'action et de caméra ? Sinon, quels éléments ont été ignorés ou mal interprétés ?
  2. Cohérence des personnages. (Si vous utilisez des références) Le personnage correspond-il aux images de référence ? Les traits du visage, les vêtements et les proportions sont-ils stables entre les plans ?
  3. Qualité audio. Le dialogue est-il intelligible ? Les effets sonores interviennent-ils aux bons moments ? L'atmosphère ambiante est-elle appropriée ?
  4. Qualité du mouvement. Les mouvements sont-ils naturels ? Y a-t-il des déformations, des scintillements ou des incohérences temporelles ?
  5. Composition globale. Le cadrage fonctionne-t-il ? L'éclairage est-il cohérent ? Le rythme vous semble-t-il juste ?

Itérer avec l'édition par instruction

C'est ici que l'avantage du flux de travail de H3 devient évident. Quand votre génération est correcte à 85–90 % et qu'un seul élément nécessite une correction, ne régénérez pas depuis zéro. Utilisez plutôt l'édition par instruction (instruction-based editing).

Envoyez une instruction de suivi décrivant uniquement le changement souhaité :

  • « Change la couleur de la veste en bleu marine. »
  • « Remplace l'arrière-plan par une plage au coucher du soleil. »
  • « Rends le mouvement de caméra plus lent dans la première moitié. »
  • « Change l'expression du personnage pour quelque chose de plus surpris. »

Le modèle applique la modification à la génération existante tout en préservant le cadrage, l'éclairage, la performance et le chemin de caméra. C'est nettement plus efficace que de régénérer — vous conservez ce qui fonctionne et corrigez ce qui ne fonctionne pas.

Astuce pro : Si votre première instruction d'édition ne produit pas le résultat souhaité, essayez de la reformuler avec plus de spécificité. « Change l'arrière-plan » est vague. « Remplace l'arrière-plan par un mur de studio blanc avec un éclairage directionnel doux venant du haut à gauche » est suffisamment précis pour que le modèle puisse agir.

Quand régénérer plutôt que modifier

L'édition par instruction est puissante, mais elle n'est pas toujours le bon choix :

  • Sortie fondamentalement erronée (mauvais sujet, scène complètement fausse, mouvement incohérent) : régénérez avec un prompt révisé.
  • Problèmes multiples interconnectés (si corriger un point nécessite des changements en cascade) : régénérer peut être plus propre que d'empiler plusieurs instructions d'édition.
  • Souhait d'une nouvelle direction créative : parfois la meilleure approche est d'essayer un prompt complètement différent plutôt que de forcer des modifications sur une génération qui part dans la mauvaise direction.

Étape 5 : Exportez et intégrez

Télécharger votre vidéo

Les vidéos générées sont livrées au format MP4. Sur l'interface web Hailuo, cliquez sur le bouton de téléchargement une fois la génération terminée. Via l'API, la réponse de tâche terminée contient une URL de téléchargement.

Important : Les liens vidéo expirent 24 heures après la génération. Téléchargez et sauvegardez vos fichiers rapidement. Si vous construisez un pipeline automatisé, implémentez une étape qui récupère et stocke le MP4 sur votre propre espace de stockage dès l'achèvement de la tâche.

Intégration en post-production

Pour la plupart des cas d'usage, la vidéo générée nécessitera quelques retouches finales avant d'être prête pour la livraison :

  • Éléments de marque. Ajoutez logos, filigranes et textes spécifiques à la marque dans votre logiciel de montage vidéo. H3 gère bien les scènes visuelles, mais la typographie précise et le placement de logo restent plus sûrs en post-production.
  • Étalonnage couleur (color grading). Si votre marque a une palette de couleurs ou un aspect spécifique, appliquez un étalonnage en post-production pour aligner la vidéo générée avec votre identité visuelle.
  • Mixage audio. Bien que H3 génère un audio synchronisé, vous souhaiterez peut-être ajuster les niveaux, ajouter une nappe musicale ou remplacer le dialogue par une voix off (voice-over) professionnelle pour la livraison finale.
  • Formatage pour la plateforme. Exportez dans le codec, le débit binaire et le format de conteneur requis par votre plateforme cible (H.264 MP4 pour la plupart des plateformes sociales, ProRes pour la diffusion télévisée, etc.).

Modèles de prompts utilisables immédiatement

Copiez, personnalisez et générez. Ces modèles sont structurés pour une efficacité maximale avec H3.

Modèle A : Plan produit cinématique

`` A [product] rests on [surface] inside [environment]. The camera [movement description] as [lighting effect]. [Atmospheric detail]. [Visual style] commercial aesthetic, [lighting quality]. [Audio: ambient sound + subtle effect]. ``

Exemple : `` A matte black perfume bottle rests on a white marble slab inside a dimly lit studio. The camera slowly orbits to the right as a single spotlight sweeps across the glass surface. Fine mist particles float in the air. Minimalist luxury commercial aesthetic, dramatic directional lighting. Soft ambient hum and gentle glass resonance. ``

Modèle B : Récit centré sur un personnage

`` [Character description] [action sequence in chronological order]. Begin with [opening shot], [transition shot], then finish on [closing shot]. [Dialogue or vocal quality]. [Ambient sounds] + [background music]. ``

Exemple : `` A middle-aged man in a worn leather jacket sits alone at a rain-streaked window in a dimly lit diner. He stares at an old photograph, then slowly folds it and puts it in his pocket. Begin with a wide shot of the empty diner, cut to a medium close-up of his hands holding the photo, then finish on a tight close-up of his weathered face. Quiet, gravelly breathing. Rain against glass, distant highway traffic, muted jukebox playing a slow blues track. ``

Modèle C : Accroche pour réseaux sociaux

`` Quick [opening action] reveals [subject] in [setting]. Camera [dynamic movement]. [Second action/beat]. [Third action/beat with visual payoff]. [Style] aesthetic, [vibrant/moody/energetic] mood. [Punchy audio: beat drop / sound effect / music style]. ``

Exemple : `` Quick hand swipe reveals a pair of glowing neon sneakers floating in a dark warehouse. Camera dollies forward rapidly. The sneakers drop and land on a reflective wet floor, sending sparks outward. Urban streetwear aesthetic, high-energy mood. Heavy bass beat drop on impact, electronic hum, echo reverb. ``

Modèle D : Prévisualisation / Storyboard

`` [Scene description] with [key elements]. Camera: [specific shot instruction]. Lighting: [lighting description]. Mood: [emotional tone]. Style: [reference style]. Pre-viz storyboard shot, cinematic quality. [Audio mood]. ``

Exemple : `` A crowded Tokyo street at night with neon signs, umbrella-carrying pedestrians, and a wet asphalt road. Camera: handheld following shot behind a young woman walking briskly through the crowd. Lighting: warm neon glow with cold blue reflections on wet ground. Mood: tense, anticipatory. Style: Blade Runner-inspired neo-noir. Pre-viz storyboard shot, cinematic quality. Muffled crowd noise, rain footsteps, distant electronic music. ``


Erreurs courantes et comment les éviter

ErreurPourquoi cela arriveSolution
Le personnage change d'apparence d'un plan à l'autreAucune image de référence utilisée, ou références de mauvaise qualitéTéléchargez des images de référence propres, bien éclairées et de face
L'audio ne correspond pas aux visuelsLes instructions visuelles et audio sont mêlées dans le promptSéparez la description visuelle de la description audio ; placez les repères audio à la fin
Les mouvements de caméra semblent aléatoiresLe prompt décrit la scène mais pas la caméraSpécifiez toujours explicitement le mouvement de caméra en langage professionnel de plan
Trop de choses en 15 secondesLe prompt essaie de caser une histoire complète en une seule générationLimitez-vous à 2–3 actions par génération ; utilisez plusieurs générations pour les récits plus longs
L'instruction d'édition a changé trop ou trop peuL'instruction était soit trop vague, soit trop largeSoyez précis sur ce qui change et ce qui reste ; un seul changement clair par instruction
Le lien vidéo a expiré avant le téléchargementOubli de l'expiration de 24 heuresTéléchargez immédiatement après la génération ; automatisez le stockage dans les pipelines API

Carte de référence rapide

ParamètreOptionsRecommandation
Durée5–15 secondesCommencez par 5 s pour les tests, passez à 15 s pour la production
Ratio d'aspect21:9, 16:9, 4:3, 1:1, 3:4, 9:16Adaptez-vous à votre plateforme cible
Qualité2KPar défaut — pas d'autre option au lancement
Images de référence0–9Utilisez 2 à 5 pour une meilleure cohérence des personnages
Vidéo de référence0–3Utilisez 1 à 2 pour le transfert de mouvement/style
Audio de référence0–3Utilisez 1 pour l'ancrage vocal (nécessite une image ou vidéo)
Longueur du promptChinois : ≤500 caractères ; Anglais : ≤1000 motsConcis mais précis

参考资料

  • OpenArt Tutorial: https://openart.ai/ai-model/minimax-h3/
  • EvoLink API Guide: https://evolink.ai/zh/hailuo-3
  • DeeVid Prompting Tips: https://deevid.ai/blog/minimax-h3-review
  • Atlas Cloud Guide: https://www.atlascloud.ai/zh/models/minimax-h3
  • OrcaRouter Explained: https://www.orcarouter.ai/blog/minimax-h3-hailuo-3-explained

Related articles