30:00:00

10 Gratis-Credits bei Registrierung · 20% OFF Jahresabo

Jahresangebote ansehen
Tutorials

MiniMax H3 verwenden: Eine Schritt-für-Schritt-Anleitung zur Erstellung von 2K-KI-Videos

M

AI video generation & studio workflow guides.

14 min read
MiniMax H3 verwenden: Eine Schritt-für-Schritt-Anleitung zur Erstellung von 2K-KI-Videos

MiniMax H3 ist jetzt live. Sie haben die Spezifikationen gelesen, die Demos gesehen und möchten es selbst ausprobieren. Diese Anleitung führt Sie durch…

MiniMax H3 ist jetzt live. Sie haben die Spezifikationen gelesen, die Demos gesehen und möchten es selbst ausprobieren. Diese Anleitung führt Sie durch den gesamten Prozess — von der Auswahl Ihrer Plattform über das Schreiben Ihres ersten Prompts bis hin zur Iteration des Ergebnisses — damit Sie so effizient wie möglich von null zu einem brauchbaren 2K-Video mit synchronisiertem Audio gelangen.

Es wird keine Vorerfahrung mit KI-Videoerzeugung vorausgesetzt. Wenn Sie bereits andere Modelle verwendet haben, springen Sie zu den für Sie relevanten Abschnitten; H3 hat genügend einzigartige Funktionen (Omni-Reference, anweisungsbasierte Bearbeitung), dass selbst erfahrene Nutzer hier Neuland finden werden.


Schritt 1: Wählen Sie Ihren Einstiegspunkt

H3 ist über mehrere Kanäle zugänglich. Der richtige hängt davon ab, ob Sie eine visuelle Oberfläche für schnelles Testen oder eine API für die Integration in einen Produktionsworkflow bevorzugen.

Option A: Hailuo-Offizielle-Website (hailuoai.video)

Dies ist der einfachste Weg. Registrieren Sie sich auf hailuoai.video, wählen Sie H3 aus dem Modellmenü und beginnen Sie über eine browserbasierte Oberfläche zu erzeugen. Keine Programmierung erforderlich. Keine API-Schlüssel zu verwalten.

Am besten geeignet für: einzelne Kreative, Ersttester, alle, die H3s Ausgabequalität evaluieren möchten, bevor sie sich auf eine API-Integration einlassen. Kuratierte Beispiele, Tipps und die neuesten H3-News finden Sie auch auf minimaxh3.art.

Für Entwickler, die Produkte oder automatisierte Workflows erstellen, bietet EvoLink eine programmatische Schnittstelle mit drei Modell-IDs basierend auf Ihrem Eingabetyp:

Modell-IDVerwenden Sie, wenn
minimax-h3-text-to-videoSie nur aus einem Text-Prompt erzeugen
minimax-h3-image-to-videoSie ein erstes Bild, letztes Bild oder beides als Anker haben
minimax-h3-reference-to-videoSie multimodale Referenzen (Bilder + Video + Audio) für maximale Steuerung bereitstellen möchten

Die API ist asynchron: Sie senden eine Aufgabe ab, erhalten eine Aufgaben-ID, fragen den Status ab und laden die resultierende MP4 herunter, wenn sie abgeschlossen ist. Es gibt keinen Abbruch-Endpunkt — wenn eine Aufgabe fehlschlägt, erhalten Sie eine vollständige Rückerstattung.

Eine grundlegende Anfrage sieht so aus:

``json { "model": "minimax-h3-text-to-video", "prompt": "A lone traveler walks along a windswept cliff at golden hour, cinematic tracking shot", "duration": 5, "quality": "2k", "aspect_ratio": "16:9" } ``

Preisgestaltung: ~$0,13 pro Ausgabesekunde bei 2K. Ein 5-Sekunden-Clip kostet ~$0,65; ein 15-Sekunden-Clip ~$1,95. Referenzbilder und Audio sind kostenlos; Referenzvideoclips addieren ihre Dauer zur abrechenbaren Zeit.

Option C: Drittanbieter-Plattformen

OpenArt, Atlas Cloud und andere Inferenzanbieter bieten H3 über ihre eigenen Oberflächen an, oft mit einheitlicher API-Kompatibilität und nutzungsbasierter Abrechnung. Diese können praktisch sein, wenn Sie bereits Konten auf diesen Plattformen haben und MiniMax H3 in derselben Umgebung mit anderen Modellen vergleichen möchten.


Schritt 2: Einen starken Prompt schreiben

Der Prompt ist die wichtigste Eingabe, die Sie bereitstellen. H3 folgt Ihren Anweisungen genau, was bedeutet, dass vage Prompts vage Ergebnisse liefern und spezifische Prompts spezifische Ergebnisse liefern. Der Unterschied zwischen einer mittelmäßigen und einer großartigen Erzeugung liegt oft an der Promptqualität.

Die empfohlene Struktur

Betrachten Sie Ihren Prompt als ein kompaktes Produktionsbriefing. Die effektivsten Prompts folgen dieser Reihenfolge:

Subjekt → Szene → Aktion → Kamera → Timing → Visueller Stil → Audio

Sie müssen nicht jedes Element in jedem Prompt einbeziehen. Aber die wichtigsten abzudecken gibt dem Modell genug zu arbeiten, und die Reihenfolge hilft ihm zu verstehen, was am wichtigsten ist.

Beispiel 1: Produktwerbung

`` A luxury silver watch rests on a dark stone pedestal inside a modern gallery. The camera slowly pushes forward as a beam of light moves across the metal surface. Fine dust floats in the air. Premium cinematic commercial style, controlled movement, high contrast lighting, subtle mechanical ticking and deep ambient sound. ``

Beachten Sie, wie dieser Prompt alle sieben Elemente abdeckt:

  • Subjekt: luxury silver watch
  • Szene: dark stone pedestal, modern gallery
  • Aktion: light beam moves across the surface
  • Kamera: slowly pushes forward
  • Visueller Stil: premium cinematic commercial, high contrast
  • Audio: mechanical ticking, deep ambient sound

Beispiel 2: Narrative Szene

`` A young woman enters a quiet cafe during heavy rain. She closes her umbrella, looks toward the counter and notices an old friend. Begin with a wide exterior shot, cut to a medium tracking shot as she enters, then finish on a close-up of her surprised expression. Natural dialogue ambience, rain against the windows and soft piano music. ``

Dieser Prompt demonstriert Multi-Beat-Storytelling: Er beschreibt eine Abfolge von Ereignissen über die Zeit, spezifiziert drei verschiedene Einstellungen mit expliziten Kameraanweisungen und definiert sowohl die Umgebungs- als auch die musikalische Audioebene.

Beispiel 3: Actionszene

`` First-person POV, eye level, handheld game footage. A player holding an assault rifle advances slowly along the perimeter of a modern military base. The crosshair scans the corridor ahead; after a brief pause, the player fires several rounds at a distant target point, then continues forward. Cold natural lighting mixed with smoke and muzzle flash. Subtle handheld sway with small lateral glances, minor recoil vibration when firing, then steady forward movement. ``

Dieser Prompt zeigt, wie man Perspektive (First-Person POV), physisches Verhalten (Rückstoß, Schwanken) und Atmosphäre (kaltes Licht, Rauch, Mündungsfeuer) für hochintensive Inhalte spezifiziert.

Promptregeln, die wirklich wichtig sind

Basierend auf frühen Nutzertests und Plattformdokumentation machen diese Richtlinien den konsistentesten Unterschied:

  1. Schreiben Sie Kamerabewegungen in professioneller Einstellungssprache. „Langsamer Orbit nach rechts" funktioniert besser als „Kamera bewegt sich umher". „Handgeführte Verfolgungseinstellung" funktioniert besser als „folgt der Figur". H3 folgt Filmvokabular — verwenden Sie es.
  1. Beschreiben Sie Ereignisse in chronologischer Reihenfolge. Das Modell interpretiert Ihren Prompt als Zeitachse. Wenn Sie das Ende vor dem Anfang beschreiben, kann es die Einstellungen umsortieren.
  1. Begrenzen Sie die Anzahl der Hauptaktionen. Ein 15-Sekunden-Clip kann 2–3 verschiedene Aktionen oder Storybeats unterstützen. Der Versuch, sechs Ereignisse in 15 Sekunden unterzubringen, produziert verwirrte Ausgaben.
  1. Trennen Sie visuelle Anweisungen von Audioanweisungen. Platzieren Sie zuerst Ihre visuelle Beschreibung und fügen Sie dann Audiohinweise am Ende hinzu. Dies hilft dem Modell zu erkennen, welche Anweisungen auf welchen Ausgabekanal anzuwenden sind.
  1. Benennen Sie, was konsistent bleiben muss. Wenn das Aussehen einer Figur, das Branding eines Produkts oder ein Hintergrundelement über Einstellungen hinweg stabil bleiben muss, sagen Sie es explizit.
  1. Füllen Sie nicht jede Sekunde mit einem neuen Ereignis. H3 bewältigt Tempo und Pausen. Raum für Momente der Stille zu lassen, produziert natürlichere Ergebnisse als eine sekundengenaue Aktionsliste.

Schritt 3: Omni-Reference für maximale Steuerung nutzen

Omni-Reference ist H3s herausragende Funktion und der Punkt, an dem sich das Modell von der Konkurrenz abhebt. So verwenden Sie es effektiv.

Was Sie hochladen können

ReferenztypMaximumDauergrenzenDateigröße
BilderBis zu 9Je 30 MB
VideoclipsBis zu 3Je 2–15 Sekunden; 15 Sekunden gesamt pro TypJe 50 MB
AudioclipsBis zu 3Je 2–15 Sekunden; 15 Sekunden gesamt pro TypJe 15 MB
Dateien gesamt1264 MB Anfragelimit

Wichtige Einschränkungen:

  • Audio kann nicht allein eingereicht werden — es muss mit mindestens einem Bild oder Video gepaart werden.
  • Die Dauer von Referenzvideos wird zu Ihrer abrechenbaren Ausgabedauer addiert; Referenzbilder und Audio nicht.
  • Unterstützte Formate: JPG, PNG, WEBP, HEIC, HEIF (Bilder); H.264, H.265 (Video); WAV, MP3 (Audio).

So bereiten Sie Referenzbilder vor

Die Qualität Ihrer Referenzbilder bestimmt direkt die Qualität Ihrer Zeichenkonsistenz. Folgen Sie diesen Richtlinien:

  • Gleichmäßige Beleuchtung. Vermeiden Sie harte Schatten, starke Gegenbeleuchtung oder gemischte Farbtemperaturen. Ein gut beleuchtetes Gesicht mit minimalen Schatten gibt dem Modell die brauchbarsten Daten.
  • Direkter Gesichtswinkel. Frontale oder nahezu frontale Fotos funktionieren am besten. Seitenansichten, Dreiviertelwinkel und geneigte Köpfe reduzieren die Fähigkeit des Modells, die Identität zu fixieren.
  • Keine Verdeckungen. Hüte, Sonnenbrillen, Haare im Gesicht, Hände, die Merkmale bedecken — all dies reduziert die Effektivität der Referenz.
  • Saubere Hintergrundkulisse. Ein einfacher, aufgeräumter Hintergrund hilft dem Modell, das Subjekt vom Umfeld zu trennen.
  • Mehrere Winkel, wenn möglich. Wenn Sie mehrere Referenzplätze zur Verfügung haben, nutzen Sie sie: einer frontal, einer in leichtem Winkel, einer in Ganzkörperansicht. Das gibt dem Modell ein vollständigeres Bild.

So bereiten Sie Audioreferenzen vor

Audioreferenzen verankern die Stimme einer Figur. Dieselben Qualitätsprinzipien gelten:

  • Verwenden Sie eine saubere Aufnahme mit minimalem Hintergrundgeräusch.
  • 2–15 Sekunden klarer Sprache sind ausreichend.
  • Konsistenter Stimmklang (kein Flüstern-zu-Schreien-Übergang innerhalb des Clips).
  • Wenn Sie einen bestimmten Akzent oder Sprachstil anstreben, sollte die Referenz diesen demonstrieren.

Wann Omni-Reference vs. Text-zu-Video verwenden

SzenarioEmpfohlener Modus
Schneller Konzepttest, keine spezifische Figur benötigtText-zu-Video
Produktanimation aus einem ProduktfotoBild-zu-Video (erstes Bild)
Figur muss in Einstellungen spezifisch aussehen und klingenOmni-Reference
Stilübertragung aus vorhandenem FilmmaterialOmni-Reference (Videoclip)
Werbekreativ mit einer MarkenmaskeOmni-Reference (Bilder + Audio)
Musikvideo mit konsistentem DarstellerOmni-Reference (Bilder + Video + Audio)

Schritt 4: Erzeugen, überprüfen und iterieren

Ihre Erzeugung einrichten

Bevor Sie auf „Erzeugen" klicken, konfigurieren Sie diese Parameter:

  • Dauer: Beginnen Sie mit 5 Sekunden zum Testen. Sobald Sie mit dem Prompt und den Referenzen zufrieden sind, erweitern Sie auf 10 oder 15 Sekunden.
  • Seitenverhältnis: Passen Sie es an Ihre Zielplattform an. 9:16 für TikTok/Reels/Shorts. 16:9 für YouTube und allgemeine Nutzung. 1:1 für Instagram-Feed. 21:9 für filmisches Breitbildformat.
  • Qualität: 2K ist die einzige Option beim Start — dies ist die Standardeinstellung und die empfohlene Einstellung.

Was Sie in Ihrer ersten Erzeugung bewerten sollten

Schauen Sie sich die Ausgabe nicht nur einmal an und gehen Sie weiter. Bewerten Sie systematisch:

  1. Prompttreue. Hat das Modell Ihren Subjekt-, Szenen-, Aktions- und Kameraanweisungen gefolgt? Wenn nicht, welche Elemente wurden ignoriert oder falsch interpretiert?
  2. Zeichenkonsistenz. (Bei Verwendung von Referenzen) Stimmt die Figur mit den Referenzbildern überein? Sind Gesichtszüge, Kleidung und Proportionen über Einstellungen hinweg stabil?
  3. Audioqualität. Sind die Dialoge verständlich? Landen Geräuscheffekte im richtigen Moment? Ist die Umgebungsatmosphäre angemessen?
  4. Bewegungsqualität. Sind Bewegungen natürlich? Gibt es Verzerrungen, Flimmern oder zeitliche Inkonsistenzen?
  5. Gesamtkomposition. Funktioniert die Bildkomposition? Ist die Beleuchtung konsistent? Fühlt sich das Tempo richtig an?

Mit anweisungsbasielter Bearbeitung iterieren

Hier wird H3s Workflow-Vorteil deutlich. Wenn Ihre Erzeugung zu 85–90 % stimmt und ein Element korrigiert werden muss, erzeugen Sie nicht von Grund auf neu. Verwenden Sie stattdessen anweisungsbasierte Bearbeitung.

Senden Sie eine Folgeanweisung, die nur die gewünschte Änderung beschreibt:

  • „Ändere die Jackenfarbe zu Marineblau."
  • „Ersetze den Hintergrund durch einen Sonnenuntergangsstrand."
  • „Mache die Kamerabewegung in der ersten Hälfte langsamer."
  • „Ändere den Ausdruck der Figur zu mehr Überraschung."

Das Modell wendet die Bearbeitung auf die bestehende Erzeugung an und bewahrt dabei die Bildkomposition, Beleuchtung, Darbietung und den Kamerapfad. Das ist wesentlich effizienter als eine Neuerzeugung — Sie behalten, was funktioniert, und korrigieren, was nicht funktioniert.

Profi-Tipp: Wenn Ihre erste Bearbeitungsanweisung nicht das gewünschte Ergebnis liefert, formulieren Sie sie mit mehr Spezifität um. „Ändere den Hintergrund" ist vage. „Ersetze den Hintergrund durch eine weiße Studiowand mit weicher Richtbeleuchtung von oben links" ist spezifisch genug, damit das Modell darauf reagieren kann.

Wann stattdessen neu erzeugen statt bearbeiten

Anweisungsbasierte Bearbeitung ist leistungsfähig, aber nicht immer die richtige Wahl:

  • Grundsätzlich falsche Ausgabe (falsches Subjekt, völlig falsche Szene, inkohärente Bewegung): Erzeugen Sie mit einem überarbeiteten Prompt neu.
  • Mehrere miteinander verbundene Probleme (wenn die Korrektur einer Sache kaskadierende Änderungen erfordern würde): Eine Neuerzeugung sauberer sein als das Stapeln mehrerer Bearbeitungsanweisungen.
  • Ein völlig neuer kreativer Richtungswechsel: Manchmal ist der beste Schritt, einen komplett anderen Prompt auszuprobieren, anstatt Bearbeitungen an einer Erzeugung zu erzwingen, die in die falsche Richtung geht.

Schritt 5: Exportieren und integrieren

Ihr Video herunterladen

Erzeugte Videos werden als MP4-Dateien geliefert. Auf der Hailuo-Weboberfläche klicken Sie auf die Schaltfläche „Herunterladen", wenn die Erzeugung abgeschlossen ist. Über die API enthält die abgeschlossene Aufgabenantwort eine Download-URL.

Wichtig: Videolinks laufen 24 Stunden nach der Erzeugung ab. Laden Sie Ihre Dateien umgehend herunter und speichern Sie sie. Wenn Sie eine automatisierte Pipeline aufbauen, implementieren Sie einen Schritt, der die MP4 sofort nach Aufgabenabschluss abruft und in Ihrem eigenen Speicher ablegt.

Postproduktionsintegration

Für die meisten Anwendungsfälle wird das erzeugte Video einige Feinschliffe benötigen, bevor es zur finalen Lieferung bereit ist:

  • Markenelemente. Fügen Sie Logos, Wasserzeichen und markenspezifische Textüberlagerungen in Ihrem Videoeditor hinzu. H3 bewältigt visuelle Szenen gut, aber präzise Typografie und Logoplatzierung sind in der Nachbearbeitung sicherer.
  • Farbkorrektur (Color Grading). Wenn Ihre Marke eine bestimmte Farbpalette oder einen bestimmten Look hat, wenden Sie eine Farbkorrektur an, um das erzeugte Video an Ihre visuelle Identität anzupassen.
  • Tonmischung (Audio Mixing). Während H3 synchronisiertes Audio erzeugt, möchten Sie möglicherweise Pegel anpassen, eine Musikuntermischung hinzufügen oder Dialoge durch eine professionelle Vertonung ersetzen, bevor Sie die finale Version liefern.
  • Plattformformatierung. Exportieren Sie im Codec, der Bitrate und dem Containerformat, das Ihre Zielplattform erfordert (H.264 MP4 für die meisten sozialen Plattformen, ProRes für Rundfunk usw.).

Prompt-Vorlagen, die Sie sofort verwenden können

Kopieren, anpassen und erzeugen. Diese Vorlagen sind für maximale Wirksamkeit mit H3 strukturiert.

Vorlage A: Filmische Produktaufnahme

`` A [product] rests on [surface] inside [environment]. The camera [movement description] as [lighting effect]. [Atmospheric detail]. [Visual style] commercial aesthetic, [lighting quality]. [Audio: ambient sound + subtle effect]. ``

Beispiel: `` A matte black perfume bottle rests on a white marble slab inside a dimly lit studio. The camera slowly orbits to the right as a single spotlight sweeps across the glass surface. Fine mist particles float in the air. Minimalist luxury commercial aesthetic, dramatic directional lighting. Soft ambient hum and gentle glass resonance. ``

Vorlage B: Figurengetriebene Erzählung

`` [Character description] [action sequence in chronological order]. Begin with [opening shot], [transition shot], then finish on [closing shot]. [Dialogue or vocal quality]. [Ambient sounds] + [background music]. ``

Beispiel: `` A middle-aged man in a worn leather jacket sits alone at a rain-streaked window in a dimly lit diner. He stares at an old photograph, then slowly folds it and puts it in his pocket. Begin with a wide shot of the empty diner, cut to a medium close-up of his hands holding the photo, then finish on a tight close-up of his weathered face. Quiet, gravelly breathing. Rain against glass, distant highway traffic, muted jukebox playing a slow blues track. ``

Vorlage C: Social-Media-Hook

`` Quick [opening action] reveals [subject] in [setting]. Camera [dynamic movement]. [Second action/beat]. [Third action/beat with visual payoff]. [Style] aesthetic, [vibrant/moody/energetic] mood. [Punchy audio: beat drop / sound effect / music style]. ``

Beispiel: `` Quick hand swipe reveals a pair of glowing neon sneakers floating in a dark warehouse. Camera dollies forward rapidly. The sneakers drop and land on a reflective wet floor, sending sparks outward. Urban streetwear aesthetic, high-energy mood. Heavy bass beat drop on impact, electronic hum, echo reverb. ``

Vorlage D: Pre-Visualization / Storyboard

`` [Scene description] with [key elements]. Camera: [specific shot instruction]. Lighting: [lighting description]. Mood: [emotional tone]. Style: [reference style]. Pre-viz storyboard shot, cinematic quality. [Audio mood]. ``

Beispiel: `` A crowded Tokyo street at night with neon signs, umbrella-carrying pedestrians, and a wet asphalt road. Camera: handheld following shot behind a young woman walking briskly through the crowd. Lighting: warm neon glow with cold blue reflections on wet ground. Mood: tense, anticipatory. Style: Blade Runner-inspired neo-noir. Pre-viz storyboard shot, cinematic quality. Muffled crowd noise, rain footsteps, distant electronic music. ``


Häufige Fehler und wie man sie vermeidet

FehlerWarum es passiertLösung
Figur sieht in jeder Einstellung anders ausKeine Referenzbilder verwendet oder Referenzen sind von niedriger QualitätLaden Sie saubere, gleichmäßig beleuchtete, frontale Referenzbilder hoch
Audio stimmt nicht mit den visuellen Inhalten übereinVisuelle und Audioanweisungen sind im Prompt vermischtTrennen Sie die visuelle Beschreibung von der Audiobeschreibung; platzieren Sie Audiohinweise am Ende
Kamerabewegungen wirken zufälligPrompt beschreibt die Szene, aber nicht die KameraSpezifizieren Sie Kamerabewegungen immer explizit mit professioneller Einstellungssprache
Zu viel passiert in 15 SekundenPrompt versucht, eine ganze Handlung in einer Erzeugung unterzubringenBegrenzen Sie auf 2–3 Aktionen pro Erzeugung; verwenden Sie mehrere Erzeugungen für längere Geschichten
Bearbeitungsanweisung hat zu viel oder zu wenig geändertBearbeitungsanweisung war entweder zu vage oder zu breitSeien Sie spezifisch, was sich ändern soll und was bleibt; eine klare Änderung pro Anweisung
Videolink ist vor dem Herunterladen abgelaufenDie 24-Stunden-Ablaufzeit vergessenSofort nach der Erzeugung herunterladen; Speicherung in API-Pipelines automatisieren

Schnellreferenzkarte

ParameterOptionenEmpfehlung
Dauer5–15 SekundenMit 5s zum Testen beginnen, auf 15s für Produktion erweitern
Seitenverhältnis21:9, 16:9, 4:3, 1:1, 3:4, 9:16An Ihre Zielplattform anpassen
Qualität2KStandard — keine andere Option beim Start
Referenzbilder0–92–5 für beste Zeichenkonsistenz verwenden
Referenzvideo0–31–2 für Bewegungs-/Stilübertragung verwenden
Referenzaudio0–31 für Stimmenverankerung verwenden (erfordert Bild oder Video)
PromptlängeDeutsch: ≤500 Zeichen; Englisch: ≤1000 WörterPrägnant, aber spezifisch

参考资料

  • OpenArt Tutorial: https://openart.ai/ai-model/minimax-h3/
  • EvoLink API Guide: https://evolink.ai/zh/hailuo-3
  • DeeVid Prompting Tips: https://deevid.ai/blog/minimax-h3-review
  • Atlas Cloud Guide: https://www.atlascloud.ai/zh/models/minimax-h3
  • OrcaRouter Explained: https://www.orcarouter.ai/blog/minimax-h3-hailuo-3-explained

Related articles