Un personaje que se sostenga en otra escena
Pon el mismo rostro y la misma ropa como Image 1 y escribe la acción nueva. Pasar la identidad del sujeto es el objetivo de diseño, no una garantía de calce exacto: compara el resultado con tu referencia.
En MiniMax H3 Max referencia a video cargas hasta 12 imágenes, clips y audios. El prompt lleva su sujeto, estilo, movimiento o voz a una escena nueva de 5 a 15 segundos.
Production preview
Las dos salen de la galería de ejemplos de este modelo: el mismo MiniMax H3 Max referencia a video que corre el generador de arriba, las mismas dos referencias, renderizadas dos veces.
Referencias: Image 1 es una foto suelta del hombre de cerca; Image 2 es una foto suelta del hombre de lejos — nunca salieron juntos en una foto. Prompt: "The near man says flatly: 'Did you hear about H3 Max?' A beat of silence, wind moving across the lot. The far man's mouth pulls into a slow half-smile and he answers, warm and certain: 'Dude, I love it.' The near man exhales and shakes his head once, almost smiling. Native audio, lip-synced English dialogue, distant traffic hum, wind. No music, no subtitles, no camera movement." El resultado los junta en una sola escena, con el rostro y la ropa de cada uno tomados de su foto, y el diálogo sale nativo, con labios sincronizados, en la misma pasada.

Las mismas dos fotos sueltas y el mismo prompt, publicadas como segunda toma en la galería de ejemplos del modelo. El encuadre y cómo lo dicen caen distinto: un chequeo útil de cuánto puede variar el resultado entre intentos con las mismas referencias y el mismo prompt.

Sujeto, personaje o estilo — nómbralas en el prompt como Image 1, Image 2, y así.
Movimiento o cámara, de 2 a 15 segundos cada uno, con duración combinada de hasta 15 segundos — nómbralos Video 1, Video 2.
Voz o sonido, de 2 a 15 segundos cada uno — nómbralos Audio 1, Audio 2. Los tres tipos son opcionales por separado; combínalos como quieras, hasta 12 archivos en total.
La relación de aspecto arranca en adaptativa — toma la forma de tus referencias — o eliges uno de seis cuadros fijos.
Los mismos tres niveles que texto a video e imagen a video de este modelo: 480P para un chequeo rápido, 768P o 1080P para la que te quedas.
En un plan de pago puedes sacar más de un resultado con el mismo set y el mismo prompt; la primera toma está en todos los planes.
Hasta 9 imágenes, 3 clips de video (2–15 s cada uno) y 3 clips de audio (2–15 s cada uno): 12 archivos como máximo, y ninguno de los tres tipos es obligatorio por sí solo.
Nombra cada referencia por tipo y orden — Image 1, Video 1, Audio 1 — y describe la acción nueva. El modelo las lee por ese orden, no por el nombre de archivo.
480P, 768P o 1080P; de 5 a 15 segundos; relación de aspecto adaptativa por defecto. Mira el resultado, ajusta una referencia o una línea y vuelve a correr.
Encargos en los que el punto es llevar algo concreto a un plano nuevo, no partir de un prompt en blanco.
Pon el mismo rostro y la misma ropa como Image 1 y escribe la acción nueva. Pasar la identidad del sujeto es el objetivo de diseño, no una garantía de calce exacto: compara el resultado con tu referencia.
Una referencia de empaque o producto sostiene color, forma y etiqueta mientras el resto de la escena cambia alrededor.
Un clip corto de referencia puede prestar su movimiento — un paneo, un dolly, un giro — a otro sujeto y otro espacio.
Un clip de audio de referencia ancla la voz mientras el prompt escribe el diálogo nuevo de la escena.
Mezcla la imagen de un personaje, la de un producto y un clip corto de movimiento en el mismo prompt: hasta 12 archivos en total entre los tres tipos.
Quédate con las referencias de una escena que ya funciona y reescribe solo el diálogo del prompt para una pasada en otro idioma.
Imagen a video toma un fotograma como apertura literal del clip. Referencia a video trata hasta 12 imágenes, clips y audios como material del que el video nuevo toma sujeto, estilo, movimiento o voz: ninguno tiene que ser el fotograma de apertura, y puede tomar más de uno a la vez.
No. Imágenes, videos y audios de referencia son opcionales cada uno por su cuenta: puedes mandar solo imágenes, solo un video, o cualquier mezcla, mientras el total no pase de 12.
Nómbralas por tipo y orden en el texto del prompt — Image 1, Image 2, Video 1, Audio 1 — en el mismo orden en que las adjuntaste. Así las identifica el modelo, no por el nombre de archivo.
De 2 a 15 segundos cada uno. La suma de los clips de video, y por separado la de los de audio, también tiene un tope de 15 segundos.
480P, 768P o 1080P, y de 5 a 15 segundos. La relación de aspecto arranca en adaptativa — toma la forma de las referencias — o fijas una de seis.
La misma tarifa por segundo que texto a video e imagen a video de este modelo: 480P son 7 créditos por segundo, 768P son 15 y 1080P son 30; una toma de 5 segundos a 480P sale 35 créditos.
La consistencia es el objetivo, no una garantía: compara el resultado real con tu referencia, sobre todo si importa un parecido preciso o un detalle de producto.
En el generador de arriba: elige el modelo MiniMax H3 Max y la pestaña Referencia a vídeo. Es el mismo generador que abren los enlaces «Arma el set» de esta página.
La vía más rápida y barata para cazar una apertura antes de comprometerte con la que te quedas.
Qué vía para 2K, borradores o la que te quedas — uno al lado del otro.
Mira cuánto sale una toma de referencia a video en este sitio antes de empezar.
Una foto más tu propio audio: la boca sigue la pista.
480P son 7 créditos por segundo, 768P son 15 y 1080P son 30: la misma tabla que texto a video e imagen a video de este modelo. Una toma de 5 segundos a 480P sale 35 créditos.
¡Aprovecha 30% OFF por tiempo limitado!
Entran hasta 12 imágenes, clips y audios. Sale un video nuevo, con el sujeto, estilo, movimiento o voz de tus referencias.