30:00:00

10 crediti gratis alla registrazione · -20% annuale

Vedi offerte annuali
Tutorials

Come Usare MiniMax H3: Guida Passo dopo Passo per Creare Video AI in 2K

M

AI video generation & studio workflow guides.

15 min read
Come Usare MiniMax H3: Guida Passo dopo Passo per Creare Video AI in 2K

MiniMax H3 è ora online. Avete letto le specifiche, avete visto le demo e volete provarlo da soli. Questa guida vi accompagna attraverso l'intero…

MiniMax H3 è ora online. Avete letto le specifiche, avete visto le demo e volete provarlo da soli. Questa guida vi accompagna attraverso l'intero processo — dalla scelta della piattaforma alla scrittura del primo prompt fino all'iterazione sul risultato — così potete passare da zero a un video 2K utilizzabile con audio sincronizzato nel modo più efficiente possibile.

Non si presume alcuna esperienza pregressa con la generazione video AI. Se avete usato altri modelli in precedenza, saltate alle sezioni più rilevanti per voi; H3 ha abbastanza funzionalità uniche (Omni-Reference, modifica basata su istruzioni) che anche gli utenti esperti troveranno qui territorio nuovo.


Passo 1: Scegliere il Vostro Punto di Ingresso

H3 è accessibile attraverso diversi canali. Quello giusto dipende dal fatto che vogliate un'interfaccia visiva per test rapidi o un'API per l'integrazione in un flusso di lavoro di produzione.

Opzione A: Sito Ufficiale Hailuo (hailuoai.video)

Questo è il percorso più semplice. Registratevi su hailuoai.video, selezionate H3 dal menu dei modelli e iniziate a generare attraverso un'interfaccia basata su browser. Nessuna programmazione richiesta. Nessuna chiave API da gestire.

Ideale per: creator individuali, tester alla prima esperienza, chiunque voglia valutare la qualità dell'output di H3 prima di impegnarsi in un'integrazione API. Potete anche trovare esempi curati, consigli e le ultime novità su H3 su minimaxh3.art.

Per gli sviluppatori che costruiscono prodotti o flussi di lavoro automatizzati, EvoLink fornisce un'interfaccia programmatica con tre ID modello basati sul tipo di input:

ID ModelloQuando Usare
minimax-h3-text-to-videoState generando solo da un prompt testuale
minimax-h3-image-to-videoAvete un primo fotogramma, ultimo fotogramma, o entrambi per ancorare la generazione
minimax-h3-reference-to-videoVolete fornire riferimenti multimodali (immagini + video + audio) per il massimo controllo

L'API è asincrona: inviate un task, ricevete un ID task, controllate lo stato e scaricate l'MP4 risultante al completamento. Non esiste un endpoint di cancellazione — se un task fallisce, ricevete un rimborso completo.

Una richiesta base ha questo aspetto:

``json { "model": "minimax-h3-text-to-video", "prompt": "A lone traveler walks along a windswept cliff at golden hour, cinematic tracking shot", "duration": 5, "quality": "2k", "aspect_ratio": "16:9" } ``

Prezzo: ~$0,13 per secondo di output a 2K. Una clip di 5 secondi costa ~$0,65; una clip di 15 secondi ~$1,95. Le immagini e l'audio di riferimento sono gratuiti; le clip video di riferimento aggiungono la loro durata al tempo fatturabile.

Opzione C: Piattaforme Terze

OpenArt, Atlas Cloud e altri provider di inferenza offrono H3 attraverso le proprie interfacce, spesso con compatibilità API unificata e prezzi a consumo. Possono essere convenienti se avete già account su quelle piattaforme e volete confrontare MiniMax H3 con altri modelli nello stesso ambiente.


Passo 2: Scrivere un Prompt Efficace

Il prompt è l'input più importante che fornite. H3 segue le vostre istruzioni da vicino, il che significa che prompt vaghi producono risultati vaghi e prompt specifici producono risultati specifici. La differenza tra una generazione mediocre e una grande spesso si riduce alla qualità del prompt.

La Struttura Consigliata

Pensate al vostro prompt come a un brief di produzione compatto. I prompt più efficaci seguono questa sequenza:

Soggetto → Scena → Azione → Telecamera → Tempismo → Stile Visivo → Audio

Non dovete includere ogni elemento in ogni prompt. Ma coprire quelli principali dà al modello abbastanza materiale su cui lavorare, e l'ordine lo aiuta a capire cosa conta di più.

Esempio 1: Pubblicità di Prodotto

`` A luxury silver watch rests on a dark stone pedestal inside a modern gallery. The camera slowly pushes forward as a beam of light moves across the metal surface. Fine dust floats in the air. Premium cinematic commercial style, controlled movement, high contrast lighting, subtle mechanical ticking and deep ambient sound. ``

Notate come questo prompt copre tutti e sette gli elementi:

  • Soggetto: orologio d'argento di lusso
  • Scena: piedistallo di pietra scura, galleria moderna
  • Azion: il fascio di luce si muove sulla superficie
  • Telecamera: avanza lentamente
  • Stile visivo: spot cinematografico premium, alto contrasto
  • Audio: ticchettio meccanico, suono ambientale profondo

Esempio 2: Scena Narrativa

`` A young woman enters a quiet cafe during heavy rain. She closes her umbrella, looks toward the counter and notices an old friend. Begin with a wide exterior shot, cut to a medium tracking shot as she enters, then finish on a close-up of her surprised expression. Natural dialogue ambience, rain against the windows and soft piano music. ``

Questo prompt dimostra la narrazione multi-momento: descrive una sequenza di eventi nel tempo, specifica tre inquadrature distinte con indicazioni esplicite della telecamera e definisce sia gli strati audio ambientali che musicali.

Esempio 3: Scena d'Azione

`` First-person POV, eye level, handheld game footage. A player holding an assault rifle advances slowly along the perimeter of a modern military base. The crosshair scans the corridor ahead; after a brief pause, the player fires several rounds at a distant target point, then continues forward. Cold natural lighting mixed with smoke and muzzle flash. Subtle handheld sway with small lateral glances, minor recoil vibration when firing, then steady forward movement. ``

Questo prompt mostra come specificare la prospettiva (POV in prima persona), il comportamento fisico (rinculo, oscillazione) e l'atmosfera (luce fredda, fumo, fuoco di bocca) per contenuti ad alta intensità.

Regole di Prompting che Contano Davvero

Sulla base dei primi test degli utenti e della documentazione della piattaforma, queste linee guida fanno la differenza più coerente:

  1. Scrivete i movimenti della telecamera in linguaggio professionale delle inquadrature. "Slow orbit to the right" funziona meglio di "camera moves around." "Handheld tracking shot" funziona meglio di "following the character." H3 segue il vocabolario cinematografico — usatelo.
  1. Descrivete gli eventi in ordine cronologico. Il modello interpreta il vostro prompt come una timeline. Se descrivete la fine prima dell'inizio, potrebbe riordinare le inquadrature.
  1. Limitate il numero di azioni principali. Una clip di 15 secondi può supportare 2–3 azioni o momenti narrativi distinti. Cercare di inserire sei eventi in 15 secondi produce output confuso.
  1. Separate le istruzioni visive da quelle audio. Posizionate prima la descrizione visiva, poi aggiungete i segnali audio alla fine. Questo aiuta il modello a parsare quali istruzioni si applicano a quale canale di output.
  1. Nominate ciò che deve rimanere coerente. Se l'aspetto di un personaggio, il branding di un prodotto o un elemento di sfondo deve rimanere stabile tra le inquadrature, ditelo esplicitamente.
  1. Non riempite ogni secondo con un nuovo evento. H3 gestisce il ritmo e le pause. Lasciare spazio a momenti di immobilità produce risultati più naturali di una lista di azioni secondo per secondo.

Passo 3: Usare Omni-Reference per il Massimo Controllo

Omni-Reference è la funzionalità distintiva di H3, ed è dove il modello si separa dalla concorrenza. Ecco come usarla efficacemente.

Cosa Potete Caricare

Tipo di RiferimentoMassimoLimiti di DurataDimensione File
ImmaginiFino a 930 MB ciascuna
Clip videoFino a 32–15 secondi ciascuna; 15 secondi totali per tipo50 MB ciascuna
Clip audioFino a 32–15 secondi ciascuna; 15 secondi totali per tipo15 MB ciascuna
File totali12Limite corpo richiesta 64 MB

Vincoli chiave:

  • L'audio non può essere inviato da solo — deve essere abbinato ad almeno un'immagine o un video.
  • La durata del video di riferimento viene aggiunta al tempo di output fatturabile; le immagini e l'audio di riferimento no.
  • Formati supportati: JPG, PNG, WEBP, HEIC, HEIF (immagini); H.264, H.265 (video); WAV, MP3 (audio).

Come Preparare le Immagini di Riferimento

La qualità delle vostre immagini di riferimento determina direttamente la qualità della coerenza del personaggio. Seguite queste linee guida:

  • Illuminazione uniforme. Evitate ombre dure, forte controluce o temperature di colore miste. Un viso ben illuminato con ombre minime fornisce al modello i dati più utilizzabili.
  • Angolo frontale del viso. Le foto frontali o quasi frontali funzionano meglio. Le inquadrature di profilo, gli angoli a tre quarti e le teste inclinate riducono la capacità del modello di bloccare l'identità.
  • Nessun ostacolo. Cappelli, occhiali da sole, capelli sul viso, mani che coprono i tratti — tutto questo riduce l'efficacia del riferimento.
  • Sfondo pulito. Uno sfondo semplice, ordinato, aiuta il modello a separare il soggetto dall'ambiente.
  • Più angoli se possibile. Se avete diversi slot di riferimento disponibili, usateli: uno frontale, uno con lieve angolazione, uno a figura intera. Questo fornisce al modello un'immagine più completa.

Come Preparare i Riferimenti Audio

I riferimenti audio ancorano la voce di un personaggio. Gli stessi principi di qualità si applicano:

  • Usate una registrazione pulita con rumore di fondo minimo.
  • 2–15 secondi di parlato chiaro sono sufficienti.
  • Tono vocale coerente (nessuna transizione da sussurro a grido all'interno della clip).
  • Se state puntando a un accento o pattern di parlato specifico, il riferimento dovrebbe dimostrarlo.

Quando Usare Omni-Reference vs. Testo-a-Video

ScenarioModalità Consigliata
Test rapido del concetto, nessun personaggio specifico necessarioTesto-a-video
Animazione del prodotto da una foto del prodottoImmagine-a-video (primo fotogramma)
Il personaggio deve apparire e suonare in modo specifico tra le inquadratureOmni-reference
Trasferimento di stile da filmati esistentiOmni-reference (clip video)
Creativo pubblicitario con mascotte del brandOmni-reference (immagini + audio)
Video musicale con performer coerenteOmni-reference (immagini + video + audio)

Passo 4: Generare, Revisionare e Fare Iterazione

Configurare la Generazione

Prima di premere genera, configurate questi parametri:

  • Durata: Iniziate con 5 secondi per il test. Una volta soddisfatti del prompt e dei riferimenti, estendete a 10 o 15 secondi.
  • Rapporto d'aspetto: Abbinate alla vostra piattaforma target. 9:16 per TikTok/Reels/Shorts. 16:9 per YouTube e uso generale. 1:1 per il feed Instagram. 21:9 per il formato cinematografico widescreen.
  • Qualità: Il 2K è l'unica opzione al lancio — è l'impostazione predefinita e consigliata.

Cosa Valutare nella Prima Generazione

Non guardate l'output una volta e passate oltre. Valutate sistematicamente:

  1. Aderenza al prompt. Il modello ha seguito le vostre istruzioni su soggetto, scena, azione e telecamera? In caso contrario, quali elementi sono stati ignorati o male interpretati?
  2. Coerenza del personaggio. (Se usate riferimenti) Il personaggio corrisponde alle immagini di riferimento? I tratti del viso, l'abbigliamento e le proporzioni sono stabili tra le inquadrature?
  3. Qualità audio. I dialoghi sono intelligibili? Gli effetti sonori atterrano nei momenti giusti? L'atmosfera ambientale è appropriata?
  4. Qualità del movimento. I movimenti sono naturali? Ci sono distorsioni, sfarfallii o inconsistenze temporali?
  5. Composizione complessiva. L'inquadratura funziona? L'illuminazione è coerente? Il ritmo è giusto?

Fare Iterazione con la Modifica Basata su Istruzioni

Ecco dove il vantaggio del flusso di lavoro di H3 diventa evidente. Quando la vostra generazione è corretta al 85–90% e un elemento necessita di correzione, non rigenerate da zero. Usate invece la modifica basata su istruzioni.

Inviate un'istruzione di follow-up che descrive solo il cambiamento desiderato:

  • "Change the jacket color to navy blue."
  • "Replace the background with a sunset beach."
  • "Make the camera movement slower in the first half."
  • "Change the character's expression to more surprised."

Il modello applica la modifica alla generazione esistente preservando l'inquadratura, l'illuminazione, la performance e il percorso della telecamera. Questo è drasticamente più efficiente che rigenerare — mantenete ciò che funziona e correggete ciò che non funziona.

Consiglio da professionisti: Se la vostra prima istruzione di modifica non produce il risultato desiderato, provate a riformularla con maggiore specificità. "Change the background" è vago. "Replace the background with a white studio wall with soft directional lighting from the upper left" è sufficientemente specifico perché il modello possa agire.

Quando Rigenerare Invece di Modificare

La modifica basata su istruzioni è potente, ma non è sempre la scelta giusta:

  • Output fondamentalmente sbagliato (soggetto errato, scena completamente sbagliata, movimento incoerente): rigenerate con un prompt rivisto.
  • Problemi multipli interconnessi (se correggere una cosa richiederebbe modifiche a cascata): rigenerare potrebbe essere più pulito che impilare multiple istruzioni di modifica.
  • Desiderio di una nuova direzione creativa: a volte la mossa migliore è provare un prompt completamente diverso anziché forzare modifiche su una generazione che sta andando nella direzione sbagliata.

Passo 5: Esportare e Integrare

Scaricare il Video

I video generati vengono consegnati come file MP4. Sull'interfaccia web Hailuo, cliccate il pulsante di download una volta che la generazione è completa. Tramite API, la risposta del task completato contiene un URL di download.

Importante: I link video scadono 24 ore dopo la generazione. Scaricate e salvate i vostri file prontamente. Se state costruendo una pipeline automatizzata, implementate un passaggio che recupera e salva l'MP4 nel vostro storage immediatamente al completamento del task.

Integrazione nella Post-Produzione

Per la maggior parte dei casi d'uso, il video generato necessiterà di alcuni ritocchi finali prima di essere pronto per la consegna definitiva:

  • Elementi del brand. Aggiungete loghi, watermark e sovrapposizioni di testo specifiche del brand nel vostro editor video. H3 gestisce bene le scene visive, ma la tipografia di precisione e il posizionamento del logo sono ancora più sicuri in post-produzione.
  • Correzione del colore. Se il vostro brand ha una palette di colori o un aspetto specifico, applicate una correzione del colore in post per allineare il video generato alla vostra identità visiva.
  • Mixaggio audio. Sebbene H3 generi audio sincronizzato, potreste voler aggiustare i livelli, aggiungere un tappeto musicale o sostituire i dialoghi con una voce fuori campo professionale per la consegna finale.
  • Formattazione per piattaforma. Esportate nel codec, bitrate e formato contenitore richiesti dalla vostra piattaforma target (H.264 MP4 per la maggior parte delle piattaforme social, ProRes per la messa in onda, ecc.).

Modelli di Prompt da Usare Subito

Copiate, personalizzate e generate. Questi modelli sono strutturati per la massima efficacia con H3.

Modello A: Inquadratura Cinematografica di Prodotto

`` A [product] rests on [surface] inside [environment]. The camera [movement description] as [lighting effect]. [Atmospheric detail]. [Visual style] commercial aesthetic, [lighting quality]. [Audio: ambient sound + subtle effect]. ``

Esempio: `` A matte black perfume bottle rests on a white marble slab inside a dimly lit studio. The camera slowly orbits to the right as a single spotlight sweeps across the glass surface. Fine mist particles float in the air. Minimalist luxury commercial aesthetic, dramatic directional lighting. Soft ambient hum and gentle glass resonance. ``

Modello B: Narrazione Basata su Personaggi

`` [Character description] [action sequence in chronological order]. Begin with [opening shot], [transition shot], then finish on [closing shot]. [Dialogue or vocal quality]. [Ambient sounds] + [background music]. ``

Esempio: `` A middle-aged man in a worn leather jacket sits alone at a rain-streaked window in a dimly lit diner. He stares at an old photograph, then slowly folds it and puts it in his pocket. Begin with a wide shot of the empty diner, cut to a medium close-up of his hands holding the photo, then finish on a tight close-up of his weathered face. Quiet, gravelly breathing. Rain against glass, distant highway traffic, muted jukebox playing a slow blues track. ``

Modello C: Gancio per Social Media

`` Quick [opening action] reveals [subject] in [setting]. Camera [dynamic movement]. [Second action/beat]. [Third action/beat with visual payoff]. [Style] aesthetic, [vibrant/moody/energetic] mood. [Punchy audio: beat drop / sound effect / music style]. ``

Esempio: `` Quick hand swipe reveals a pair of glowing neon sneakers floating in a dark warehouse. Camera dollies forward rapidly. The sneakers drop and land on a reflective wet floor, sending sparks outward. Urban streetwear aesthetic, high-energy mood. Heavy bass beat drop on impact, electronic hum, echo reverb. ``

Modello D: Pre-Visualizzazione / Storyboard

`` [Scene description] with [key elements]. Camera: [specific shot instruction]. Lighting: [lighting description]. Mood: [emotional tone]. Style: [reference style]. Pre-viz storyboard shot, cinematic quality. [Audio mood]. ``

Esempio: `` A crowded Tokyo street at night with neon signs, umbrella-carrying pedestrians, and a wet asphalt road. Camera: handheld following shot behind a young woman walking briskly through the crowd. Lighting: warm neon glow with cold blue reflections on wet ground. Mood: tense, anticipatory. Style: Blade Runner-inspired neo-noir. Pre-viz storyboard shot, cinematic quality. Muffled crowd noise, rain footsteps, distant electronic music. ``


Errori Comuni e Come Evitarli

ErrorePerché AccadeSoluzione
Il personaggio appare diverso in ogni inquadraturaNessuna immagine di riferimento usata, o i riferimenti sono di bassa qualitàCaricate immagini di riferimento pulite, illuminate uniformemente, frontali
L'audio non corrisponde al visivoIstruzioni visive e audio intrecciate nel promptSeparate la descrizione visiva da quella audio; posizionate i segnali audio alla fine
I movimenti della telecamera sembrano casualiIl prompt descrive la scena ma non la telecameraSpecificate sempre il movimento della telecamera esplicitamente usando linguaggio professionale delle inquadrature
Troppe cose succedono in 15 secondiIl prompt cerca di inserire un'intera trama in una generazioneLimitate a 2–3 azioni per generazione; usate generazioni multiple per storie più lunghe
L'istruzione di modifica ha cambiato troppo o troppo pocoL'istruzione di modifica era troppo vaga o troppo ampiaSiate specifici su cosa cambia e cosa resta; un chiaro cambiamento per istruzione
Il link del video è scaduto prima del downloadDimenticata la scadenza delle 24 oreScaricate immediatamente dopo la generazione; automatizzate lo storage nelle pipeline API

Scheda di Riferimento Rapido

ParametroOpzioniRaccomandazione
Durata5–15 secondiIniziate con 5s per il test, estendete a 15s per la produzione
Rapporto d'aspetto21:9, 16:9, 4:3, 1:1, 3:4, 9:16Abbinate alla vostra piattaforma target
Qualità2KPredefinito — nessun'altra opzione al lancio
Immagini di riferimento0–9Usate 2–5 per la migliore coerenza del personaggio
Video di riferimento0–3Usate 1–2 per il trasferimento di movimento/stile
Audio di riferimento0–3Usate 1 per l'ancoraggio della voce (richiede immagine o video)
Lunghezza promptCinese: ≤500 caratteri; Inglese: ≤1000 paroleConciso ma specifico

参考资料

  • OpenArt Tutorial: https://openart.ai/ai-model/minimax-h3/
  • EvoLink API Guide: https://evolink.ai/zh/hailuo-3
  • DeeVid Prompting Tips: https://deevid.ai/blog/minimax-h3-review
  • Atlas Cloud Guide: https://www.atlascloud.ai/zh/models/minimax-h3
  • OrcaRouter Explained: https://www.orcarouter.ai/blog/minimax-h3-hailuo-3-explained

Related articles