Escribe un prompt
Describe el sujeto, el movimiento de cámara, la luz y el ambiente.

Todavía no hay video generado
Escribe un prompt y pulsa generar para empezar
Describe el sujeto, el movimiento de cámara, la luz y el ambiente.
Opcionalmente, adjunta hasta dos imágenes de primer/último fotograma.
Elige 5, 10 o 15 segundos y una de las cinco proporciones.
Revisa el resultado, ajusta el prompt y genera de nuevo.
4
modalidades de entrada
texto · imagen · vídeo · audio
2K
salida nativa del modelo
capacidad oficial del modelo
24
fotogramas por segundo
cadencia de movimiento cinematográfica
5–15s
clips con audio
ajustes del sitio: 5 / 10 / 15 s
Modelo / 01
MiniMax H3 es el modelo de vídeo multimodal de propósito general y pesos abiertos de MiniMax. Acepta texto, imágenes, vídeo y audio, y genera vídeo 2K nativo a 24 fps con diálogo, efectos de sonido y ambiente en una sola pasada.
Finalización / 02
Entrega un resultado directamente a una herramienta de edición, o sube un clip para mejorarlo, cambiarlo o redirigirlo.
Mejora y afina vídeos de IA a mayor resolución.
Sustituye un rostro para trabajos creativos o de localización autorizados.
Cambia la cabeza conservando el movimiento original.
Redirige el movimiento y el lenguaje de cámara usando un clip de referencia.
Aplica el flujo de intercambio de rostros a imágenes fijas.
Omni-reference / 03
MiniMax H3 puede combinar identidad, movimiento, estilo visual y dirección de sonido en una sola generación.
Vídeo 2K nativo + audio sincronizado
Vídeos / 04
Seis ejemplos de MiniMax H3 que abarcan cine de marca, creatividad multimedia, narrativa, publicidad de producto, movimiento de interfaz y animación estilizada.
Un concepto de moda cinematográfico que coordina personaje, producto, entorno y lenguaje de cámara.
Imágenes reales se funden con una animación dibujada a mano, luminosa y con sonido ambiental.
Un tráiler vertical construye continuidad del personaje, tensión y progresión plano a plano.
Un montaje de moda rápido mantiene el producto legible mientras varía rostros y encuadres.
Una interfaz de producto se convierte en una demo de interacción pulida con transiciones espaciales.
Tipografía inglesa audaz y la presentación de un héroe estilo novela gráfica crean un ritmo de tráiler compacto.
Especificaciones / 05
Casos de uso / 06
Cinematics, PV de personajes y conceptos de interfaz animada con identidad visual estable.
Arcilla, pixel art, anime y fantasía 3D con un aspecto consistente entre planos.
Convierte fotos de producto en demostraciones, vídeos explicativos y conceptos de campaña.
Conceptos de formato corto para campañas de social, display y televisión conectada.
Dirige tráilers, películas de marca y dramas cortos con lenguaje de cámara y sonido.
Clips verticales para Shorts, Reels y narrativas listas para TikTok.
Comparativa / 07
| Capacidad | MiniMax H3 | Hailuo 2.3 |
|---|---|---|
| Resolución máxima | 2K nativo | 1080P |
| Duración máxima | 15 segundos | 10 segundos |
| Audio nativo | Sí | No |
| Entradas de referencia | Imágenes + vídeo + audio | Primer fotograma |
| Límite del prompt | 7.000 caracteres | 2.000 caracteres |
| Pesos | Abiertos | API cerrada |
Laboratorio de prompts / 08
Copia un prompt y pégalo en el generador de arriba. MiniMax H3 ya está seleccionado.
Un viajero solitario baja de un cupé clásico en una autopista del desierto y alza una bolsa de cuero contra el viento. Empieza con un travelling abierto, pasa a detalles táctiles del producto, luz cálida de atardecer, ruido de motor contenido y ambiente de desierto.
En una cocina silenciosa, una mano deja un vaso sobre la encimera y unas enredaderas dibujadas a mano y brillantes se extienden desde el punto de contacto. Encuadre de móvil en mano, luz natural de la mañana, sonido ambiente sutil de la sala y un suave destello mientras crece la animación del boceto.
Un joven vampiro y una detective humana se encuentran bajo un reloj de estación empapado por la lluvia mientras llega un tren a lo lejos. Construye desde un plano de dos incómodo hasta primeros planos, luz azul de luna y luces prácticas rojas, ambiente de lluvia y vías, terminando en su mirada fija.
Crea una campaña vertical de gafas con tres modelos seguros que se pasan un par de gafas plateadas entre cortes de empalme. Luz de estudio nítida, acercamientos rápidos, sonidos rítmicos de obturador y fondos gráficos limpios; termina con un plano hero del producto en el centro.
Convierte una tarjeta flotante de asistente de IA en una demo premium de interacción web. La tarjeta se expande en un espacio de trabajo por capas, los paneles encajan con un parallax suave, gradientes fríos y sonidos de interfaz discretos, terminando en el panel final completado.
Un cultivador de espadas cruza un puente de nubes mientras grullas espirituales rodean un templo lejano en la montaña. Usa un barrido amplio de grúa seguido de un travelling lateral rápido, niebla luminosa, estilo fantástico 3D en verde azulado y dorado, ambiente de viento y campanas, terminando cuando se abre la puerta del templo.
Dirección / 09
El H3 responde mejor cuando un prompt dirige el cambio a lo largo del tiempo, no solo una imagen estática. Da a cada uno de estos seis elementos una tarea clara.
Sujeto e intención
Nombra el sujeto principal, su objetivo y los detalles que deben seguir siendo reconocibles.
Acción a lo largo del tiempo
Describe el estado inicial, el movimiento o cambio clave y cómo debe terminar el plano.
Escena y reacción
Define el lugar, el tiempo y la atmósfera, y explica cómo reacciona el entorno a la acción.
Lenguaje de cámara
Elige el encuadre y el movimiento: general, primer plano, cámara en mano, travelling, grúa o una transición deliberada.
Aspecto y sonido
Dirige la iluminación, la paleta y la textura junto con el diálogo, el ambiente, los efectos o el ritmo musical.
Coherencia de las referencias
Indica qué controla cada referencia —identidad, producto, composición, movimiento o estilo— y qué no debe cambiar.
FAQ / 10
MiniMax H3 es un modelo de vídeo multimodal de propósito general de MiniMax. Puede interpretar texto y medios de referencia, planificar el movimiento a lo largo de un plano y generar vídeo con diálogo, efectos y ambiente sincronizados.
En el uso habitual del producto se refieren a la misma familia de modelos. MiniMax H3 es el nombre oficial del modelo; Hailuo 3 es el nombre que muchos usuarios y herramientas de terceros usan para relacionarlo con las versiones anteriores de Hailuo.
Este generador ofrece clips de 5, 10 y 15 segundos. Para un clip corto, describe un único arco de acción claro en lugar de incluir varias escenas sin relación.
Sí. El H3 puede generar diálogo, efectos de sonido y ambiente junto con el visual. Incluye el hablante, la frase exacta, el entorno y la textura de sonido deseada en el prompt cuando el audio sea importante.
Este generador ofrece 480P, 720P y 1080P, con proporciones 16:9, 9:16, 4:3, 3:4 y 1:1. Elige 9:16 para vídeo social vertical, 16:9 para narrativas horizontales y 1:1 cuando el destino requiera un archivo cuadrado.
Omni-reference es la capacidad del H3 de usar imágenes, vídeo y audio como guía coordinada para identidad, movimiento, estilo visual y sonido. Esta página ofrece actualmente texto-a-vídeo más guía por imágenes de primer/último fotograma, un subconjunto centrado del modelo completo.
MiniMax describe el H3 como un modelo de pesos abiertos. El autoalojamiento sigue requiriendo capacidad de GPU adecuada, archivos del modelo y una pila de inferencia compatible; esta página es la vía alojada más sencilla para generaciones ocasionales.
Frente al Hailuo 2.3, el H3 añade audio sincronizado nativo, un control de referencia multimodal más rico, instrucciones más largas, mayor capacidad de resolución nativa y pesos abiertos. El beneficio práctico es más control sobre un plano completo, no solo un primer fotograma más potente.
Puedes escribir un prompt y preparar imágenes de referencia antes de iniciar sesión. Al hacer clic en Generar Vídeo Gratis se abre la ventana de cuenta; las cuentas nuevas reciben 20 créditos, suficientes para dos generaciones estándar de 480P y 5 segundos.
Escribe primero el sujeto y el objetivo, luego describe la acción en orden, el entorno, el movimiento de cámara, la luz y el sonido y el fotograma final. Una secuencia coherente suele dar al modelo una dirección más clara que una lista de adjetivos visuales sin relación.
Usa un primer fotograma cuando la composición de apertura, el personaje o el producto deban ser específicos. Añade un último fotograma cuando el plano deba llegar a una composición concreta; tu prompt debe explicar el movimiento que conecta las dos imágenes.
El tiempo de generación varía según la duración del clip, la resolución y la carga de la cola. Una vez aceptada la tarea, su estado se guarda en el historial de tu cuenta; mantén la página abierta para seguir el progreso en vivo o vuelve a la página de historial para ver el resultado.
Una tarea fallida muestra un error concreto siempre que el proveedor devuelva uno. Los créditos reservados para una tarea no exitosa se restablecen automáticamente; si un estado queda bloqueado, usa el ID de la tarea al contactar con el soporte.
El uso comercial depende de los términos del modelo y del servicio, además de los derechos de cada prompt, logo, rostro, voz y material de referencia que aportes. La generación no autoriza automáticamente derechos de copyright, marca, imagen o voz.
Usa solo medios de tu propiedad o que estés autorizado a editar. La suplantación no autorizada y el uso engañoso están prohibidos.
Regístrate, consigue 20 créditos y genera tu primer vídeo con audio en esta página.