Manter um personagem consistente numa cena nova
Use o mesmo rosto e a mesma roupa como Image 1 e escreva a ação nova. Levar a identidade do sujeito é a meta de design, não uma garantia pixel a pixel — compare o resultado com a referência.
Envie até 12 imagens, clipes e áudios de referência no MiniMax H3 Max. No modo referência para vídeo, o prompt leva sujeito, estilo, movimento ou voz para uma cena nova de 5 a 15 segundos.
Production preview
As duas takes vêm da galeria de exemplos deste modelo — o mesmo MiniMax H3 Max referência para vídeo do gerador acima, as mesmas duas referências, em duas gerações.
Referências: Image 1 é uma foto solo do homem da frente; Image 2 é uma foto solo do homem do fundo — os dois nunca foram fotografados juntos. Prompt: "The near man says flatly: 'Did you hear about H3 Max?' A beat of silence, wind moving across the lot. The far man's mouth pulls into a slow half-smile and he answers, warm and certain: 'Dude, I love it.' The near man exhales and shakes his head once, almost smiling. Native audio, lip-synced English dialogue, distant traffic hum, wind. No music, no subtitles, no camera movement." O resultado coloca os dois na mesma cena gerada, mantém o rosto e a roupa de cada um a partir da foto solo dele, e entrega o diálogo como áudio nativo com boca sincronizada na mesma passada.

As mesmas duas fotos solo e o mesmo prompt, publicados como segunda take na galeria de exemplos deste modelo. O enquadramento e a fala saem um pouco diferentes — um jeito de ver quanto o resultado varia entre tentativas com as mesmas referências e o mesmo prompt.

Sujeito, personagem ou estilo — citados no prompt como Image 1, Image 2, e assim por diante.
Referências de movimento ou câmera, de 2 a 15 segundos cada, com o total também limitado a 15 segundos — citados como Video 1, Video 2.
Referências de voz ou som, de 2 a 15 segundos cada — citados como Audio 1, Audio 2. Nenhum dos três tipos é obrigatório; misture até 12 arquivos no total.
A proporção começa em adaptativo — pega o formato das suas referências — ou você escolhe um dos seis quadros fixos.
As mesmas três resoluções dos modos texto para vídeo e imagem para vídeo deste modelo — 480P para um teste rápido, 768P ou 1080P para a que fica.
Gere mais de uma saída do mesmo conjunto e do mesmo prompt num plano pago; a primeira saída existe em todo plano.
Até 9 imagens, 3 clipes de vídeo (2–15s cada) e 3 clipes de áudio (2–15s cada) — 12 arquivos no máximo, e nenhum dos três tipos é obrigatório sozinho.
Nomeie cada referência por tipo e ordem — Image 1, Video 1, Audio 1 — e descreva a ação nova. O modelo lê as referências por essa ordem, não pelo nome do arquivo.
480P, 768P ou 1080P; 5 a 15 segundos; proporção adaptativa por padrão. Veja o resultado, ajuste uma referência ou uma linha e rode de novo.
Trabalhos em que o ponto é levar algo específico para um plano novo, não começar de um prompt em branco.
Use o mesmo rosto e a mesma roupa como Image 1 e escreva a ação nova. Levar a identidade do sujeito é a meta de design, não uma garantia pixel a pixel — compare o resultado com a referência.
Uma referência de embalagem ou de produto segura cor, forma e rótulo enquanto o resto da cena muda em volta.
Um clipe curto de referência pode emprestar o movimento — um pan, um dolly, um giro — a um sujeito e um cenário novos.
Um clipe de áudio de referência ancora a voz enquanto o prompt escreve o diálogo novo da cena.
Misture a foto de um personagem, a de um produto e um clipe curto de movimento no mesmo prompt — até 12 arquivos no total, nos três tipos.
Mantenha as referências de uma cena que funciona e reescreva só o diálogo no prompt para uma passada em outro idioma.
Imagem para vídeo usa uma foto como o primeiro frame literal do clipe. Referência para vídeo trata até 12 imagens, clipes e áudios como material de onde o vídeo novo tira sujeito, estilo, movimento ou voz — nenhum precisa ser o frame de abertura, e dá para usar mais de um ao mesmo tempo.
Não. Imagens, vídeos e áudios de referência são opcionais cada um por conta própria — você pode mandar só imagens, só um vídeo, ou qualquer mistura, desde que o total fique em 12 ou menos.
Nomeie por tipo e ordem no texto do prompt — Image 1, Image 2, Video 1, Audio 1 — na mesma ordem em que você anexou. É assim que o modelo identifica as referências, não pelo nome do arquivo.
De 2 a 15 segundos cada, com a duração total de vídeo (e, à parte, a duração total de áudio) também limitada a 15 segundos.
480P, 768P ou 1080P, e de 5 a 15 segundos. A proporção começa em adaptativo — pega o formato das referências — ou você trava uma das seis.
O mesmo custo por segundo dos modos texto para vídeo e imagem para vídeo deste modelo: 480P sai 7 créditos por segundo, 768P sai 15 e 1080P sai 30 — uma geração de 5 segundos em 480P custa 35 créditos.
Consistência é a meta, não uma garantia — compare o resultado real com a sua referência, principalmente se a semelhança precisa ser precisa ou se um detalhe de produto importa.
No gerador acima: escolha o modelo MiniMax H3 Max e a aba Referência para vídeo. É o mesmo gerador que os links "Rodar referências" desta página abrem.
A faixa mais rápida e barata para caçar a abertura antes de fechar a que fica.
Qual faixa para 2K, rascunhos ou a que fica — lado a lado.
Veja o que uma geração de referência para vídeo custa neste site antes de começar.
Uma foto mais o seu áudio — a boca acompanha a trilha.
480P sai 7 créditos por segundo, 768P sai 15 e 1080P sai 30 — a mesma tabela dos modos texto para vídeo e imagem para vídeo deste modelo. Uma geração de 5 segundos em 480P custa 35 créditos.
Aproveite 30% OFF por tempo limitado!
Entram até 12 imagens, clipes e áudios. Sai um vídeo novo, com sujeito, estilo, movimento ou voz das suas referências.