MiniMax H3 ya está disponible. Has leído las especificaciones, has visto las demos y quieres probarlo tú mismo. Esta guía te acompaña en todo el proceso — desde elegir tu plataforma hasta escribir tu primera indicación (prompt) y iterar sobre el resultado — para que puedas ir de cero a un vídeo utilizable en 2K con audio sincronizado de la manera más eficiente posible.
No se asume experiencia previa con generación de vídeo por IA. Si has usado otros modelos antes, salta a las secciones más relevantes para ti; H3 tiene suficientes características únicas (Omni-Reference, edición basada en instrucciones) como para que incluso los usuarios experimentados encuentren territorio nuevo aquí.
Paso 1: Elige tu punto de entrada
H3 es accesible a través de varios canales. El adecuado depende de si quieres una interfaz visual para pruebas rápidas o una API para integración en un flujo de trabajo de producción.
Opción A: Sitio web oficial de Hailuo (hailuoai.video)
Este es el camino más sencillo. Regístrate en hailuoai.video, selecciona H3 del menú de modelos y comienza a generar a través de una interfaz basada en navegador. No se requiere programación. No hay claves de API que gestionar.
Ideal para: creadores individuales, testers por primera vez, cualquiera que quiera evaluar la calidad de salida de H3 antes de comprometerse con una integración de API. También puedes encontrar ejemplos seleccionados, consejos y las últimas noticias de H3 en minimaxh3.art.
Opción B: API unificada EvoLink
Para desarrolladores que construyen productos o flujos de trabajo automatizados, EvoLink proporciona una interfaz programática con tres identificadores de modelo según tu tipo de entrada:
| ID de Modelo | Cuándo usar |
|---|---|
minimax-h3-text-to-video | Estás generando solo a partir de una indicación de texto |
minimax-h3-image-to-video | Tienes un primer fotograma, último fotograma, o ambos para anclar la generación |
minimax-h3-reference-to-video | Quieres proporcionar referencias multimodales (imágenes + vídeo + audio) para máximo control |
La API es asíncrona: envías una tarea, recibes un ID de tarea, consultas el estado por sondeo (polling) y descargas el MP4 resultante cuando se completa. No hay endpoint de cancelación — si una tarea falla, recibes un reembolso completo.
Una solicitud básica se ve así:
``json { "model": "minimax-h3-text-to-video", "prompt": "A lone traveler walks along a windswept cliff at golden hour, cinematic tracking shot", "duration": 5, "quality": "2k", "aspect_ratio": "16:9" } ``
Precio: ~$0.13 por segundo de salida a 2K. Un clip de 5 segundos cuesta ~$0.65; un clip de 15 segundos ~$1.95. Las imágenes y clips de audio de referencia son gratuitos; los clips de vídeo de referencia añaden su duración al tiempo facturable.
Opción C: Plataformas de terceros
OpenArt, Atlas Cloud y otros proveedores de inferencia ofrecen H3 a través de sus propias interfaces, a menudo con compatibilidad de API unificada y precios de pago por uso. Estas pueden ser convenientes si ya tienes cuentas en esas plataformas y quieres comparar MiniMax H3 con otros modelos en el mismo entorno.
Paso 2: Escribe una buena indicación (prompt)
La indicación es la entrada más importante que proporcionas. H3 sigue tus instrucciones de cerca, lo que significa que indicaciones vagas producen resultados vagos, e indicaciones específicas producen resultados específicos. La diferencia entre una generación mediocre y una excelente a menudo se reduce a la calidad de la indicación.
La estructura recomendada
Piensa en tu indicación como un brief de producción compacto. Las indicaciones más efectivas siguen esta secuencia:
Sujeto → Escena → Acción → Cámara → Temporización → Estilo visual → Audio
No necesitas incluir cada elemento en cada indicación. Pero cubrir los principales le da al modelo suficiente material para trabajar, y el orden le ayuda a entender qué importa más.
Ejemplo 1: Anuncio de producto
`` A luxury silver watch rests on a dark stone pedestal inside a modern gallery. The camera slowly pushes forward as a beam of light moves across the metal surface. Fine dust floats in the air. Premium cinematic commercial style, controlled movement, high contrast lighting, subtle mechanical ticking and deep ambient sound. ``
Observa cómo esta indicación cubre los siete elementos:
- Sujeto: reloj de plata de lujo
- Escena: pedestal de piedra oscura, galería moderna
- Acción: el haz de luz se desplaza sobre la superficie
- Cámara: avance lento hacia adelante
- Estilo visual: comercial cinematográfico premium, alto contraste
- Audio: tictac mecánico sutil, sonido ambiente profundo
Ejemplo 2: Escena narrativa
`` A young woman enters a quiet cafe during heavy rain. She closes her umbrella, looks toward the counter and notices an old friend. Begin with a wide exterior shot, cut to a medium tracking shot as she enters, then finish on a close-up of her surprised expression. Natural dialogue ambience, rain against the windows and soft piano music. ``
Esta indicación demuestra narrativa multi-temporal: describe una secuencia de eventos a lo largo del tiempo, especifica tres tomas distintas con direcciones de cámara explícitas y define tanto la capa de audio ambiental como la musical.
Ejemplo 3: Escena de acción
`` First-person POV, eye level, handheld game footage. A player holding an assault rifle advances slowly along the perimeter of a modern military base. The crosshair scans the corridor ahead; after a brief pause, the player fires several rounds at a distant target point, then continues forward. Cold natural lighting mixed with smoke and muzzle flash. Subtle handheld sway with small lateral glances, minor recoil vibration when firing, then steady forward movement. ``
Esta indicación muestra cómo especificar perspectiva (POV en primera persona), comportamiento físico (retroceso, balanceo) y atmósfera (luz fría, humo, fogonazo del cañón) para contenido de alta intensidad.
Reglas de indicación que realmente importan
Basándonos en pruebas tempranas de usuarios y documentación de la plataforma, estas directrices generan la diferencia más consistente:
- Escribe movimientos de cámara en lenguaje profesional de tomas. "Slow orbit to the right" funciona mejor que "camera moves around." "Handheld tracking shot" funciona mejor que "following the character." H3 sigue el vocabulario cinematográfico — úsalo.
- Describe los eventos en orden cronológico. El modelo interpreta tu indicación como una línea temporal. Si describes el final antes del inicio, puede reordenar las tomas.
- Limita el número de acciones principales. Un clip de 15 segundos puede soportar 2–3 acciones o golpes narrativos distintos. Intentar meter seis eventos en 15 segundos produce confusión en la salida.
- Separa las instrucciones visuales de las instrucciones de audio. Coloca la descripción visual primero y luego añade indicaciones de audio al final. Esto ayuda al modelo a analizar qué instrucciones aplican a cada canal de salida.
- Nombra lo que debe mantenerse consistente. Si la apariencia de un personaje, el branding de un producto o un elemento de fondo deben permanecer estables entre tomas, dilo explícitamente.
- No llenes cada segundo con un nuevo evento. H3 gestiona el ritmo y las pausas. Dejar espacio para momentos de quietud produce resultados más naturales que una lista de acciones segundo a segundo.
Paso 3: Usa Omni-Reference para máximo control
Omni-Reference es la característica insignia de H3, y es donde el modelo se separa de la competencia. Aquí te explicamos cómo usarla eficazmente.
Lo que puedes subir
| Tipo de Referencia | Máximo | Límites de Duración | Tamaño de Archivo |
|---|---|---|---|
| Imágenes | Hasta 9 | — | 30 MB cada una |
| Clips de vídeo | Hasta 3 | 2–15 segundos cada uno; 15 segundos en total por tipo | 50 MB cada uno |
| Clips de audio | Hasta 3 | 2–15 segundos cada uno; 15 segundos en total por tipo | 15 MB cada uno |
| Total de archivos | 12 | — | Límite de 64 MB por solicitud |
Restricciones clave:
- El audio no puede enviarse solo — debe combinarse con al menos una imagen o vídeo.
- La duración del vídeo de referencia se añade a tu tiempo de salida facturable; las imágenes y el audio de referencia no.
- Formatos soportados: JPG, PNG, WEBP, HEIC, HEIF (imágenes); H.264, H.265 (vídeo); WAV, MP3 (audio).
Cómo preparar imágenes de referencia
La calidad de tus imágenes de referencia determina directamente la calidad de la coherencia de tu personaje. Sigue estas directrices:
- Iluminación uniforme. Evita sombras duras, contraluces fuertes o temperaturas de color mixtas. Un rostro bien iluminado con sombras mínimas le da al modelo los datos más utilizables.
- Ángulo frontal del rostro. Las fotos frontales o casi frontales funcionan mejor. Las tomas de perfil, ángulos de tres cuartos y cabezas inclinadas reducen la capacidad del modelo de fijar la identidad.
- Sin obstrucciones. Gafas de sol, pelo cubriendo el rostro, manos tapando rasgos — todo esto reduce la efectividad de la referencia.
- Fondo limpio. Un fondo simple, sin elementos de distracción, ayuda al modelo a separar el sujeto del entorno.
- Múltiples ángulos si es posible. Si tienes varias ranuras de referencia disponibles, úsalas: una frontal, un ángulo leve, una de cuerpo completo. Esto le da al modelo una imagen más completa.
Cómo preparar referencias de audio
Las referencias de audio anclan la voz de un personaje. Se aplican los mismos principios de calidad:
- Usa una grabación limpia con mínimo ruido de fondo.
- 2–15 segundos de habla clara son suficientes.
- Tono vocal consistente (sin transiciones de susurro a grito dentro del clip).
- Si buscas un acento o patrón de habla específico, la referencia debe demostrarlo.
Cuándo usar Omni-Reference vs. Texto a Vídeo
| Escenario | Modo Recomendado |
|---|---|
| Prueba rápida de concepto, sin personaje específico | Texto a vídeo |
| Animación de producto a partir de una foto | Imagen a vídeo (primer fotograma) |
| El personaje debe verse y sonar específico entre tomas | Omni-reference |
| Transferencia de estilo a partir de metraje existente | Omni-reference (clip de vídeo) |
| Creativo publicitario con mascota de marca | Omni-reference (imágenes + audio) |
| Vídeo musical con intérprete consistente | Omni-reference (imágenes + vídeo + audio) |
Paso 4: Genera, revisa e itera
Configuración de tu generación
Antes de pulsar generar, configura estos parámetros:
- Duración: Comienza con 5 segundos para pruebas. Una vez estés satisfecho con la indicación y las referencias, extiende a 10 o 15 segundos.
- Relación de aspecto: Adáptala a tu plataforma objetivo. 9:16 para TikTok/Reels/Shorts. 16:9 para YouTube y uso general. 1:1 para feed de Instagram. 21:9 para pantalla panorámica cinematográfica.
- Calidad: 2K es la única opción al lanzamiento — es el valor predeterminado y la configuración recomendada.
Qué evaluar en tu primera generación
No solo mires la salida una vez y avances. Evalúa sistemáticamente:
- Cumplimiento de la indicación. ¿El modelo siguió tus instrucciones de sujeto, escena, acción y cámara? Si no, ¿qué elementos fueron ignorados o malinterpretados?
- Coherencia del personaje. (Si usas referencias) ¿El personaje coincide con las imágenes de referencia? ¿Los rasgos faciales, la ropa y las proporciones son estables entre tomas?
- Calidad del audio. ¿Los diálogos son inteligibles? ¿Los efectos de sonido aparecen en los momentos adecuados? ¿La atmósfera ambiental es apropiada?
- Calidad del movimiento. ¿Los movimientos son naturales? ¿Hay distorsión, parpadeo o inconsistencia temporal?
- Composición general. ¿El encuadre funciona? ¿La iluminación es consistente? ¿El ritmo se siente bien?
Iterando con edición basada en instrucciones
Aquí es donde la ventaja de flujo de trabajo de H3 se hace evidente. Cuando tu generación está en un 85–90% correcta y un elemento necesita corrección, no regeneres desde cero. Usa la edición basada en instrucciones en su lugar.
Envía una instrucción de seguimiento describiendo solo el cambio que deseas:
- "Change the jacket color to navy blue."
- "Replace the background with a sunset beach."
- "Make the camera movement slower in the first half."
- "Change the character's expression to more surprised."
El modelo aplica la edición a la generación existente mientras preserva el encuadre, la iluminación, la actuación y la trayectoria de la cámara. Esto es drásticamente más eficiente que regenerar — conservas lo que funciona y corriges lo que no.
Consejo profesional: Si tu primera instrucción de edición no produce el resultado deseado, intenta reformularla con más especificidad. "Change the background" es vago. "Replace the background with a white studio wall with soft directional lighting from the upper left" es lo suficientemente específico para que el modelo actúe.
Cuándo regenerar en lugar de editar
La edición basada en instrucciones es poderosa, pero no siempre es la elección correcta:
- Salida fundamentalmente incorrecta (sujeto equivocado, escena completamente errónea, movimiento incoherente): regenera con una indicación revisada.
- Múltiples problemas interconectados (si corregir una cosa requiere cambios en cascada): regenerar puede ser más limpio que apilar múltiples instrucciones de edición.
- Deseas una dirección creativa fresca: a veces la mejor opción es intentar una indicación completamente diferente en lugar de forzar ediciones en una generación que va en la dirección equivocada.
Paso 5: Exporta e integra
Descargando tu vídeo
Los vídeos generados se entregan como archivos MP4. En la interfaz web de Hailuo, haz clic en el botón de descarga una vez completada la generación. Vía API, la respuesta de tarea completada contiene una URL de descarga.
Importante: Los enlaces de vídeo expiran 24 horas después de la generación. Descarga y guarda tus archivos de inmediato. Si estás construyendo un pipeline automatizado, implementa un paso que obtenga y almacene el MP4 en tu propio almacenamiento inmediatamente al completarse la tarea.
Integración de postproducción
Para la mayoría de los casos de uso, el vídeo generado necesitará algunos retoques finales antes de estar listo para la entrega definitiva:
- Elementos de marca. Añade logotipos, marcas de agua y superposiciones de texto específicas de marca en tu editor de vídeo. H3 maneja bien las escenas visuales, pero la tipografía precisa y la colocación de logotipos son más seguras en postproducción.
- Graduación de color. Si tu marca tiene una paleta de colores o estética específica, aplica una graduación de color en postproducción para alinear el vídeo generado con tu identidad visual.
- Mezcla de audio. Aunque H3 genera audio sincronizado, es posible que quieras ajustar niveles, añadir una cama musical o reemplazar el diálogo con una voz en off profesional para la entrega final.
- Formato de plataforma. Exporta en el códec, tasa de bits y formato de contenedor requeridos por tu plataforma objetivo (H.264 MP4 para la mayoría de las plataformas sociales, ProRes para emisión, etc.).
Plantillas de indicación que puedes usar ahora mismo
Copia, personaliza y genera. Estas plantillas están estructuradas para máxima efectividad con H3.
Plantilla A: Toma cinematográfica de producto
`` A [product] rests on [surface] inside [environment]. The camera [movement description] as [lighting effect]. [Atmospheric detail]. [Visual style] commercial aesthetic, [lighting quality]. [Audio: ambient sound + subtle effect]. ``
Ejemplo: `` A matte black perfume bottle rests on a white marble slab inside a dimly lit studio. The camera slowly orbits to the right as a single spotlight sweeps across the glass surface. Fine mist particles float in the air. Minimalist luxury commercial aesthetic, dramatic directional lighting. Soft ambient hum and gentle glass resonance. ``
Plantilla B: Narrativa centrada en personaje
`` [Character description] [action sequence in chronological order]. Begin with [opening shot], [transition shot], then finish on [closing shot]. [Dialogue or vocal quality]. [Ambient sounds] + [background music]. ``
Ejemplo: `` A middle-aged man in a worn leather jacket sits alone at a rain-streaked window in a dimly lit diner. He stares at an old photograph, then slowly folds it and puts it in his pocket. Begin with a wide shot of the empty diner, cut to a medium close-up of his hands holding the photo, then finish on a tight close-up of his weathered face. Quiet, gravelly breathing. Rain against glass, distant highway traffic, muted jukebox playing a slow blues track. ``
Plantilla C: Gancho para redes sociales
`` Quick [opening action] reveals [subject] in [setting]. Camera [dynamic movement]. [Second action/beat]. [Third action/beat with visual payoff]. [Style] aesthetic, [vibrant/moody/energetic] mood. [Punchy audio: beat drop / sound effect / music style]. ``
Ejemplo: `` Quick hand swipe reveals a pair of glowing neon sneakers floating in a dark warehouse. Camera dollies forward rapidly. The sneakers drop and land on a reflective wet floor, sending sparks outward. Urban streetwear aesthetic, high-energy mood. Heavy bass beat drop on impact, electronic hum, echo reverb. ``
Plantilla D: Previsualización / Storyboard
`` [Scene description] with [key elements]. Camera: [specific shot instruction]. Lighting: [lighting description]. Mood: [emotional tone]. Style: [reference style]. Pre-viz storyboard shot, cinematic quality. [Audio mood]. ``
Ejemplo: `` A crowded Tokyo street at night with neon signs, umbrella-carrying pedestrians, and a wet asphalt road. Camera: handheld following shot behind a young woman walking briskly through the crowd. Lighting: warm neon glow with cold blue reflections on wet ground. Mood: tense, anticipatory. Style: Blade Runner-inspired neo-noir. Pre-viz storyboard shot, cinematic quality. Muffled crowd noise, rain footsteps, distant electronic music. ``
Errores comunes y cómo evitarlos
| Error | Por qué ocurre | Solución |
|---|---|---|
| El personaje se ve diferente en cada toma | No se usaron imágenes de referencia, o las referencias son de baja calidad | Sube imágenes de referencia limpias, con iluminación uniforme y ángulo frontal |
| El audio no coincide con los visuales | Las instrucciones visuales y de audio están mezcladas en la indicación | Separa la descripción visual de la descripción de audio; coloca las indicaciones de audio al final |
| Los movimientos de cámara se sienten aleatorios | La indicación describe la escena pero no la cámara | Siempre especifica el movimiento de cámara explícitamente usando lenguaje profesional de tomas |
| Demasiadas cosas sucediendo en 15 segundos | La indicación intenta meter una historia completa en una generación | Limita a 2–3 acciones por generación; usa múltiples generaciones para historias más largas |
| La instrucción de edición cambió demasiado o muy poco | La instrucción de edición fue demasiado vaga o demasiado amplia | Sé específico sobre qué cambia y qué permanece; un cambio claro por instrucción |
| El enlace de vídeo expiró antes de la descarga | Olvidaste la expiración de 24 horas | Descarga inmediatamente después de la generación; automatiza el almacenamiento en pipelines de API |
Tarjeta de referencia rápida
| Parámetro | Opciones | Recomendación |
|---|---|---|
| Duración | 5–15 segundos | Comienza con 5s para pruebas, extiende a 15s para producción |
| Relación de aspecto | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | Adapta a tu plataforma objetivo |
| Calidad | 2K | Valor predeterminado — no hay otra opción al lanzamiento |
| Imágenes de referencia | 0–9 | Usa 2–5 para mejor coherencia de personaje |
| Vídeo de referencia | 0–3 | Usa 1–2 para transferencia de movimiento/estilo |
| Audio de referencia | 0–3 | Usa 1 para anclaje de voz (requiere imagen o vídeo) |
| Longitud de indicación | Chino: ≤500 caracteres; Inglés: ≤1000 palabras | Conciso pero específico |
参考资料
- OpenArt Tutorial: https://openart.ai/ai-model/minimax-h3/
- EvoLink API Guide: https://evolink.ai/zh/hailuo-3
- DeeVid Prompting Tips: https://deevid.ai/blog/minimax-h3-review
- Atlas Cloud Guide: https://www.atlascloud.ai/zh/models/minimax-h3
- OrcaRouter Explained: https://www.orcarouter.ai/blog/minimax-h3-hailuo-3-explained



