30:00:00

10 Gratis-Credits bei Registrierung · 20% OFF Jahresabo

Jahresangebote ansehen
Explainers

Was ist MiniMax H3? Alles, was Sie über das Hailuo 3.0 Videomodell wissen müssen

M

AI video generation & studio workflow guides.

11 min read
Was ist MiniMax H3? Alles, was Sie über das Hailuo 3.0 Videomodell wissen müssen

Am 31. Juli 2026 hat das chinesische KI-Unternehmen MiniMax offiziell MiniMax H3 gestartet — das Modell der dritten Generation seiner…


Am 31. Juli 2026 hat das chinesische KI-Unternehmen MiniMax offiziell MiniMax H3 gestartet — das Modell der dritten Generation seiner Hailuo-Video-Familie, auch bekannt als Hailuo 3.0. Erst zwei Wochen zuvor auf der WAIC 2026 vorgestellt, kommt H3 mit einem klaren Anspruch: nicht nur bewegte Bilder zu erzeugen, sondern komplette kurze audiovisuelle Szenen — mit nativer 2K-Auflösung, synchronisiertem Ton und bis zu 15 Sekunden ununterbrochenem Filmmaterial in einer einzigen Erzeugung.

Wenn Sie die KI-Video-Szene verfolgt haben, wissen Sie, dass das Tempo des Fortschritts unaufhaltsam war. Alle paar Monate erscheinen neue Modelle, von denen jedes behauptet, die Grenzen weiter zu verschieben. Was bringt H3 also genau mit sich, und sollten Sie es beachten? Hier ist alles, was Sie wissen müssen.


Was ist MiniMax H3 — in einem Satz

MiniMax H3 ist ein multimodales KI-Videoerzeugungsmodell (AI Video Generation Model), das native 2K-Videos bei 24 fps mit eingebautem synchronisiertem Audio erzeugt — Dialoge, Geräuscheffekte und Umgebungsatmosphäre — aus Text-Prompten, Bildern oder einer Kombination aus Referenzmaterialien einschließlich Video- und Audioclips.

Es ist ein Videomodell, kein Text- oder Codiermodell. MiniMax hat gleichzeitig auf der WAIC 2026 auch sein M3-Sprachmodell (für Text, Agenten und Reasoning) veröffentlicht, und die beiden werden online häufig verwechselt. H3 konzentriert sich klar auf die Videoerstellung.


Die Spezifikationen auf einen Blick

Bevor wir darauf eingehen, was H3 interessant macht, hier der technische Überblick:

SpezifikationDetail
AuflösungNativ 2K (2560×1440)
Bildrate24 fps (Filmstandard)
Dauer5–15 Sekunden pro Erzeugung (auf ~30 Sekunden erweiterbar mit dem Extend-Tool)
AudioNatives Stereo — Dialoge, Geräuscheffekte und Umgebungsatmosphäre in einem Durchgang erzeugt
Seitenverhältnisse21:9, 16:9, 4:3, 1:1, 3:4, 9:16 (sechs Optionen)
EingabemodiText-zu-Video, Bild-zu-Video (erstes/letztes Bild), Omni-Reference-zu-Video
ReferenzlimitsBis zu 9 Bilder + 3 Videoclips + 3 Audioclips (maximal 12 Dateien pro Anfrage)
BearbeitungAnweisungsbasierte Bearbeitung (Instruction-based Editing) bestehender Erzeugungen
Preisgestaltung~$0,13/Sekunde bei 2K (ein 5-Sekunden-Clip kostet ~$0,65; ein 15-Sekunden-Clip ~$1,95)

Diese Zahlen sind wichtig, aber sie erzählen nur einen Teil der Geschichte. Die eigentliche Frage ist, was MiniMax H3 tatsächlich damit macht.


Drei Funktionen, die H3 definieren

1. Omni-Reference — Zeichenkonsistenz über Einstellungen hinweg sichern

Eines der hartnäckigsten Probleme bei KI-Videos war die Zeichenkonsistenz (Character Consistency). Erzeugen Sie eine Frau, die durch ein Café läuft, in einer Einstellung, und sie kann in der nächsten wie eine völlig andere Person aussehen. Gesichter verändern sich. Kleidung wechselt. Stimmen verschieben sich.

H3 adressiert dies mit dem, was MiniMax Omni-Reference nennt — ein Steuerungssystem, mit dem Sie bis zu 9 Referenzbilder, 3 Videoclips und 3 Audioclips in eine einzelne Erzeugungsanfrage einspeisen können. Das Modell liest all diese Eingaben als einen einheitlichen Kontext und extrahiert das Gesicht der Figur aus einem Foto, übernimmt die Kamerabewegung aus einem Videoclip und absorbiert den Stimmklang aus einer Audioprobe.

Das praktische Ergebnis: Eine Figur kann in einer Totale, einer Nahaufnahme und einer Seitenansicht innerhalb derselben 15-Sekunden-Erzeugung erscheinen — und wie dieselbe Person aussehen, sich bewegen und klingen. Für alle, die serielle Inhalte, Kurzfilme oder Markenkampagnen mit wiederkehrenden Akteuren produzieren, ist dies ein bedeutsamer Fortschritt.

Einige Tipps, um das Beste aus Omni-Reference herauszuholen:

  • Verwenden Sie Referenzbilder mit gleichmäßiger Beleuchtung, direktem Gesichtswinkel ohne Verdeckungen (Hüte, Sonnenbrillen, Haare im Gesicht).
  • Kombinieren Sie Bildreferenzen mit einem sauberen Audioclip, um sowohl Aussehen als auch Stimme zu verankern.
  • Verwenden Sie dasselbe Referenzset über Erzeugungen hinweg wieder, um Konsistenz in episodischen Inhalten zu gewährleisten.

2. Natives Audio — Vom stummen Clip zum bearbeitbaren Rohschnitt

Die meisten KI-Videomodelle haben bislang stumme Ausgaben erzeugt. Sie erhalten die visuellen Inhalte und fügen dann in einem separaten Schritt Ton hinzu — Dialoge nachvertonen, Geräuscheffekte einfügen, die richtige Hintergrundmusik finden. Es ist ein Workflow, der funktioniert, aber er verdoppelt die Produktionszeit für jeden kurzen Clip.

H3 erzeugt Audio zusammen mit Video in einem einzigen Durchgang. Dialoge landen auf den Mundbewegungen. Glas splittert, wenn es zerbricht. Regen trifft das Fenster, während eine Figur spricht. Das Timing wird während der Erzeugung selbst bestimmt und nicht nachträglich ausgerichtet.

Dies verändert die Natur der Ausgabe. Ein stummes KI-Video ist ein visuelles Asset — nützlich, aber unvollständig. Ein Video mit brauchbarem Ton kommt einem bearbeitbaren Rohschnitt (First Cut) näher. Für kurze Werbung, Social-Media-Inhalte und narrative Szenen ist dieser Unterschied signifikant.

Dennoch bedeutet „natives Audio" nicht automatisch „perfektes Audio". Die Genauigkeit von Dialogen, die Qualität der Lippen-Synchronisation (Lip-Sync), die emotionale Darbietung einer Stimme — all das muss noch in der Praxis getestet werden. Erste Nutzer haben überwiegend solide Ergebnisse berichtet, aber wie bei jedem generativen Audio können Randfälle und komplexe Szenen Artefakte produzieren. Die Empfehlung: Behandeln Sie das erzeugte Audio als starken Ausgangspunkt, nicht unbedingt als endgültiges Ergebnis.

3. Anweisungsbasierte Bearbeitung — Verfeinern ohne neu zu erzeugen

Dies ist eine Funktion, die vielleicht nicht spektakulär klingt, aber am Ende eine der praktischsten Stärken von H3 sein könnte.

Stellen Sie sich vor, Sie erzeugen einen 15-Sekunden-Clip, der zu 90 % stimmt. Die Bildkomposition ist gut, die Beleuchtung funktioniert, die Darbietung der Figur ist natürlich — aber die Jackenfarbe ist falsch, oder der Hintergrund muss geändert werden. Bei den meisten Videomodellen ist Ihre einzige Option, den Prompt anzupassen und von Grund auf neu zu erzeugen, in der Hoffnung, dass die neue Version das bewahrt, was Ihnen am Original gefallen hat.

H3 ermöglicht es Ihnen, die Änderung in natürlicher Sprache zu beschreiben und auf die bestehende Erzeugung anzuwenden. „Ändere die Jacke zu Rot." „Tausche den Hintergrund gegen einen Sonnenuntergangsstrand." „Beschleunige das Tempo in der zweiten Hälfte." Das Modell ändert nur die angegebenen Elemente und bewahrt alles andere — die Bildkomposition, die Beleuchtung, die Darbietung, den Kamerapfad.

Für iterative Kreativarbeit ist dies ein echtes Workflow-Upgrade. Es verschiebt den Prozess von „erzeugen und hoffen" zu „erzeugen und verfeinern" — genau so funktioniert professionelle Kreativproduktion tatsächlich.


Wie schneidet H3 im Vergleich zum Vorgänger ab?

Wenn Sie Hailuo 2.3, die vorherige Generation, verwendet haben, ist der Sprung zu H3 beträchtlich. Hier ein direkter Vergleich:

DimensionHailuo 2.3MiniMax H3
Auflösung768p / 1080pNativ 2K
Maximale Dauer~10 Sekunden15 Sekunden (erweiterbar auf ~30s)
ReferenzeingabeNur BilderBilder + Video + Audio
Natives AudioNeinJa — Stereo, ein Durchgang
Anweisungsbasierte BearbeitungNeinJa
PreismodellPro ErzeugungPro Ausgabesekunde
SeitenverhältnisseEingeschränktSechs Optionen (21:9 bis 9:16)

Der Auflösungssprung von 1080p auf natives 2K ist nicht nur eine Zahl auf einem Datenblatt. „Nativ" bedeutet hier, dass das Modell intern in voller 2K-Pixeldichte rendert — die gestochen scharfe Detailtreue ist in die Erzeugung selbst eingebaut und nicht durch einen separaten Upscaling-Schritt entstanden. Für Inhalte, die für große Bildschirme, Einzelhandelsdisplays oder hochauflösende Kundenlieferungen bestimmt sind, ist dieser Unterschied wichtig.

Die Dauererweiterung ist in der Praxis ebenso wichtig. Zehn Sekunden decken einen einzelnen Moment oder einen Eröffnungs-Hook ab. Fünfzehn Sekunden — mit der Möglichkeit mehrerer Einstellungen innerhalb einer Erzeugung — können eine Eröffnung, eine Schlüsselhandlung, eine Reaktion und einen visuellen Abschluss enthalten. Das ist der Unterschied zwischen einem Fragment und einer Szene.


Wie kann man auf H3 zugreifen und was kostet es?

H3 ist über mehrere Kanäle verfügbar, je nach Ihren Bedürfnissen:

Hailuo-Offizielle-Website (hailuoai.video)

Der einfachste Einstiegspunkt für einzelne Kreative. Registrieren Sie sich, wählen Sie H3 und beginnen Sie über eine Weboberfläche zu erzeugen. Keine API-Integration erforderlich.

Für Entwickler, die H3 in Produkte oder Workflows integrieren möchten. EvoLink bietet drei Modell-IDs basierend auf dem Eingabetyp:

  • minimax-h3-text-to-video — Erzeugung aus Text-Prompten
  • minimax-h3-image-to-video — Erzeugung aus erstem/letztem Standbild
  • minimax-h3-reference-to-video — Erzeugung aus multimodalen Referenzen

Die API ist asynchron: Sie senden eine Aufgabe ab, fragen den Status ab und laden die resultierende MP4 herunter. Es gibt keinen Abbruch-Endpunkt — wenn eine Aufgabe fehlschlägt, erhalten Sie eine vollständige Rückerstattung.

Drittanbieter-Plattformen

OpenArt, Atlas Cloud und andere Inferenzanbieter bieten ebenfalls H3-Zugang über ihre eigenen Oberflächen an, oft mit einheitlicher API-Kompatibilität und nutzungsbasierter Abrechnung.

Preisaufschlüsselung

  • Standardtarif: ~$0,13 pro Ausgabesekunde bei 2K-Auflösung
  • Ein 5-Sekunden-2K-Clip kostet ~$0,65
  • Ein 15-Sekunden-2K-Clip kostet ~$1,95
  • Referenzbilder und Audio erhöhen nicht die abrechenbare Dauer; Referenzvideoclips hingegen schon
  • Einige frühe Tester auf der Hailuo-Plattform haben von ~$1 für einen 15-Sekunden-2K-Clip bei Basis-Abonnementstufen berichtet — dies wurde jedoch nicht offiziell bestätigt

Im Vergleich zu Wettbewerbern: Ein 15-Sekunden-1080p-Clip bei Seedance 2.0 kostet laut Berichten etwa $4 auf Dreaminas Basistarif. Wenn diese Zahlen stimmen, bietet H3 etwa die vierfache Auflösung zu einem Viertel des Preises — ein überzeugendes Kosten-pro-Pixel-Angebot.


Wer ist MiniMax?

Für diejenigen, die weniger mit dem Unternehmen hinter dem Modell vertraut sind: MiniMax ist ein KI-Labor mit Sitz in Shanghai und eines der prominentesten KI-Unternehmen Chinas. Das Unternehmen hat im Januar 2026 einen Börsengang in Hongkong abgeschlossen und dabei angeblich rund 619 Millionen Dollar bei einer Bewertung von etwa 4 Milliarden Dollar eingesammelt. Zu seinen Unterstützern gehören Alibaba und Tencent.

MinimKonsumenten-Video-Marke ist Hailuo, die sich in der KI-Video-Community einen Ruf für starke Physiksimulation, schnelle Erzeugungsgeschwindigkeiten und erschwingliche Preise erarbeitet hat. H3 ist die dritte nummerierte Generation der Hailuo-Familie nach Hailuo 02 und Hailuo 2.3.

Es ist erwähnenswert, dass H3 ein Plattformmodell und keine Open-Weight-Veröffentlichung ist. Im Gegensatz zu MiniMachs M3-Sprachmodell (das Open-Weight-Varianten hat) ist H3 ausschließlich über APIs und die Hailuo-Plattform zugänglich. Es gibt keine Anzeichen, dass sich dies ändern wird.


Wo steht H3 in der KI-Video-Landschaft 2026?

Die Video-Modell-Landschaft Mitte 2026 ist überfüllt und wettbewerbsintensiv. Hier ist eine kurze Positionsübersicht:

ModellEntwicklerHerausragende Stärke
MiniMax H3MiniMaxOmni-Reference-Steuerung, natives Audio, anweisungsbasierte Bearbeitung, Preisgestaltung
Kling 3.0 ProKuaishouNatives 4K, starke Bewegungs- und Physiksimulation
Veo 3.1Google DeepMind48kHz hochfidelity Dialog
Seedance 2.0ByteDanceMultimodale Referenz, Audio-Integration
Wan 2.7AlibabaLip-Sync, Text-/Bild-/Video-/Audio-Eingaben
Runway Gen-4.5RunwayEtabliertes Kreativ-Tooling-Ökosystem

H3s Angebot ist nicht „höchste rohe Bildqualität" — Kling 3.0 und Veo 3.1 beide Push natives 4K. Stattdessen konkurriert H3 mit der Kombination aus Steuerung (Omni-Reference), Vollständigkeit (natives Audio in einem Durchgang), Iterationsgeschwindigkeit (anweisungsbasierte Bearbeitung) und Preis. Für viele praktische Anwendungsfälle — Social-Media-Werbung, Produktvideos, kurze narrative Inhalte — könnte diese Kombination wichtiger sein als die reine Auflösung allein.

Ein wichtiger Hinweis zur Wettbewerbslandschaft: OpenAI hat seine Sora-Web- und App-Erfahrungen im April 2026 eingestellt, wobei die API für September 2026 zur Abschaltung angesetzt ist. Sora ist keine lebensfähige Option mehr für neue Video-Workflows.


Häufig gestellte Fragen

Ist MiniMax H3 dasselbe wie Hailuo H3?

Ja. „MiniMax H3" ist die Unternehmensmarke; „Hailuo H3" ist die Produktmarke. Sie beziehen sich auf dasselbe Modell. „Hailuo 03" und „Hailuo 3" werden in manchen Kontexten ebenfalls synonym verwendet.

Unterstützt H3 4K-Ausgabe?

Nein. Die maximale Ausgabeauflösung ist natives 2K (2560×1440). Wenn Sie 4K benötigen, sind Kling 3.0 Pro oder Veo 3.1 (für 8-Sekunden-Clips) die aktuellen Optionen.

Wie lang können H3-Videos sein?

Eine einzelne Erzeugung unterstützt 5 bis 15 Sekunden. Mit dem Extend Video-Tool können Clips auf etwa 30 Sekunden erweitert werden.

Ist H3 Open-Source oder Open-Weight?

Nein. H3 wird über APIs und die Hailuo-Plattform aufgerufen. Es ist nicht als Open-Weight-Modell für lokale Bereitstellung verfügbar.

Kommt jedes H3-Video mit Audio?

Ja. Jede Erzeugung enthält natives Stereoaudio — Dialoge, Geräuscheffekte und Umgebungsatmosphäre — im selben Durchgang wie das Video erzeugt.

Kann ich H3 für kommerzielle Inhalte verwenden?

Prüfen Sie die aktuellen Nutzungsbedingungen von MiniMax für die neuesten Informationen zu kommerziellen Nutzungsrechten. Die Plattform ist für professionelle und kommerzielle Anwendungsfälle konzipiert, aber spezifische Lizenzbedingungen können variieren.

Ist H3 jetzt verfügbar?

Ja. H3 wurde am 31. Juli 2026 offiziell gestartet und ist über die Hailuo-Plattform, die EvoLink API und ausgewählte Drittanbieter zugänglich.

Wie geht H3 mit fehlgeschlagenen Aufgaben um?

Fehlgeschlagene, abgelaufene und abgelehnte Aufgaben erhalten eine vollständige Rückerstattung. Es gibt keinen Abbruch-Endpunkt — einmal eingereicht, läuft eine Aufgabe bis zum Abschluss oder Fehlschlag durch.


Fazit

MiniMax H3 ist nicht nur eine schrittweise Verbesserung gegenüber seinem Vorgänger. Es repräsentiert einen Wandel in dem, was KI-Videomodelle zu liefern versuchen: nicht isolierte bewegte Bilder, sondern komplette kurze audiovisuelle Szenen mit Bild, Ton und eingebauter Bearbeitungssteuerung.

Die native 2K-Auflösung bringt es in eine andere Qualitätsklasse als den Großteil der 1080p-Konkurrenz. Das Omni-Reference-System bietet eine ungewöhnlich großzügige Steuerung über Figuren- und Stilkonsistenz. Die native Audioerzeugung eliminiert einen separaten Postproduktionsschritt für viele kurze Workflows. Und die anweisungsbasierte Bearbeitungsfähigkeit verändert das Iterationsmodell von „neu erzeugen und hoffen" zu „beschreiben und verfeinern".

Es ist nicht das richtige Werkzeug für jede Aufgabe. Wenn Sie 4K-Ausgabe, Einstellungen länger als 15 Sekunden, Open-Weight-Bereitstellung oder 48kHz-Rundfunkqualität-Dialog benötigen, erfüllen andere Modelle diese Anforderungen derzeit besser. Aber für die wachsende Mehrheit der KI-Video-Anwendungsfälle — Social-Media-Werbung, Produktpräsentationen, kurze Erzählungen, Musikvisualisierungen, kreatives Pre-Visualization — bietet H3 eine überzeugende Kombination aus Qualität, Steuerung und Kosten, die Mitte 2026 schwer zu ignorieren ist.

Der beste Weg, es zu beurteilen, ist es selbst zu testen. Schreiben Sie einen Prompt, der Ihnen wichtig ist, erzeugen Sie einige Variationen und bewerten Sie die Ausgabe an Ihren eigenen Standards. Datenblattbewertungen und Rezensionen können Sie in die richtige Richtung weisen, aber nichts ersetzt das eigene Sehen der Ergebnisse. Für einen tieferen Einblick in H3s Fähigkeiten, Beispiele und neueste Updates können Sie auch minimaxh3.art erkunden.


参考资料

  • OpenArt: <https://openart.ai/ai-model/minimax-h3/>
  • 科创板日报: <https://www.cls.cn/detail/2442143>
  • DeeVid Review: <https://deevid.ai/blog/minimax-h3-review>
  • OrcaRouter Explained: <https://www.orcarouter.ai/blog/minimax-h3-hailuo-3-explained>
  • Kie.ai Guide: <https://kie.ai/blog/what-is-hailuo-h3>
  • EvoLink: <https://evolink.ai/zh/hailuo-3>
  • Atlas Cloud: <https://www.atlascloud.ai/zh/models/minimax-h3>

Related articles