Mantieni coerente un personaggio in una nuova scena
Usa lo stesso viso e abbigliamento come Image 1 e scrivi la nuova azione. Conservare l'identità del soggetto è un obiettivo, non una garanzia al pixel: confronta il risultato con il riferimento.
Fornisci fino a 12 immagini, video e audio di riferimento a MiniMax H3 Max, poi scrivi un prompt per portarne soggetto, stile, movimento o voce in una nuova scena di 5–15 secondi.
Production preview
Entrambi provengono dalla galleria di esempi del modello: lo stesso endpoint da riferimenti a video usato dal generatore qui sopra e gli stessi due riferimenti, generati due volte.
Riferimenti: Image 1 è una foto del solo uomo vicino; Image 2 è una foto del solo uomo lontano. Non sono mai stati fotografati insieme. Prompt: «L'uomo vicino dice in tono piatto: 'Did you hear about H3 Max?' Una pausa di silenzio, il vento attraversa il parcheggio. L'uomo lontano accenna lentamente un mezzo sorriso e risponde con calore e sicurezza: 'Dude, I love it.' L'uomo vicino espira e scuote la testa una volta, quasi sorridendo. Audio nativo, dialogo inglese con labiale sincronizzato, rumore del traffico lontano, vento. Niente musica, sottotitoli o movimenti di camera». Il risultato colloca entrambi nella stessa scena generata, mantenendo viso e abiti dalle rispettive foto, e genera il dialogo nativo sincronizzato nello stesso passaggio.

Le stesse due foto separate e lo stesso prompt, pubblicati come seconda prova nella galleria del modello. Inquadratura e recitazione cambiano leggermente: un confronto utile per osservare quanto può variare il risultato con riferimenti e prompt identici.

Riferimenti di soggetto, personaggio o stile, indicati nel prompt come Image 1, Image 2 e così via.
Riferimenti di movimento o camera, da 2–15 secondi ciascuno, con durata totale inferiore a 15 secondi; indicati come Video 1, Video 2.
Riferimenti di voce o suono, da 2–15 secondi ciascuno, indicati come Audio 1, Audio 2. Ogni tipo è facoltativo: combinali fino a un massimo di 12 file totali.
Il rapporto d'aspetto predefinito è adattivo: segue i riferimenti. Puoi anche scegliere uno dei sei formati fissi.
Le stesse tre risoluzioni delle modalità da testo e da immagine a video: 480P per una verifica rapida, 768P o 1080P per il risultato finale.
Con un piano a pagamento puoi generare più risultati dallo stesso set di riferimenti e prompt; il primo risultato è disponibile con ogni piano.
Fino a 9 immagini, 3 video (2–15 s ciascuno) e 3 audio (2–15 s ciascuno): massimo 12 file, senza obbligo di includere tutti e tre i tipi.
Indica ciascun riferimento per tipo e ordine — Image 1, Video 1, Audio 1 — e descrivi la nuova azione. Il modello li riconosce dall'ordine, non dal nome del file.
480P, 768P o 1080P; da 5 a 15 secondi; formato adattivo predefinito. Guarda il risultato, modifica un riferimento o una frase e riprova.
Lavori in cui vuoi portare un elemento preciso in una nuova inquadratura, invece di partire da un prompt vuoto.
Usa lo stesso viso e abbigliamento come Image 1 e scrivi la nuova azione. Conservare l'identità del soggetto è un obiettivo, non una garanzia al pixel: confronta il risultato con il riferimento.
Un riferimento della confezione o del prodotto mantiene colore, forma ed etichetta mentre il resto della scena cambia.
Un breve video di riferimento può trasferire il suo movimento — panoramica, carrellata o rotazione — a un nuovo soggetto e ambiente.
Un audio di riferimento può mantenere la voce mentre il prompt scrive un nuovo dialogo per la scena.
Unisci l'immagine di un personaggio, quella di un prodotto e un breve video di movimento nello stesso prompt: fino a 12 file totali tra i tre tipi.
Mantieni i riferimenti di una scena riuscita e riscrivi solo il dialogo nel prompt per una versione in un'altra lingua.
Da immagine a video usa una sola immagine come primo fotogramma effettivo. Reference to Video usa invece fino a 12 immagini, video e audio come materiale da cui ricavare soggetto, stile, movimento o voce. Nessuno deve essere il primo fotogramma e puoi fornirne più di uno insieme.
No. Immagini, video e audio sono ciascuno facoltativi: puoi inviare solo immagini, un solo video o qualsiasi combinazione, purché il totale non superi 12 file.
Indicali per tipo e ordine nel testo del prompt — Image 1, Image 2, Video 1, Audio 1 — seguendo l'ordine degli allegati. L'endpoint li identifica così, non dal nome del file.
Da 2 a 15 secondi ciascuno. Anche la durata complessiva dei video e, separatamente, quella degli audio è limitata a 15 secondi.
480P, 768P o 1080P e da 5 a 15 secondi. Il formato predefinito è adattivo e segue i riferimenti; puoi anche fissare uno dei sei rapporti disponibili.
La stessa tariffa al secondo delle modalità da testo e da immagine a video: 480P costa 10 crediti al secondo, 768P costa 20 e 1080P costa 35. Una generazione di 5 secondi a 480P costa 50 crediti.
La coerenza è l'obiettivo, non una garanzia. Confronta il risultato con il riferimento, soprattutto quando servono una somiglianza precisa o un particolare dettaglio di prodotto.
Nel generatore qui sopra: scegli MiniMax H3 Max e la scheda Reference to video. È lo stesso generatore aperto dai link «Genera con i riferimenti» della pagina.

L'opzione più rapida ed economica per cercare un'apertura prima di scegliere la ripresa finale.

I controlli di camera MiniMax H3 Max ti aiutano a decidere come lo spettatore attraversa la scena. Un avvicinamento porta in primo piano un dettaglio; un allontanamento rivela l'ambiente. Descrivi camera e soggetto separatamente: una persona che cammina verso l'obiettivo è diversa dalla camera che si avvicina alla persona.

Un'immagine e il tuo audio: la bocca segue la traccia.

Quale scegliere per 2K, bozze o risultato finale: confronto diretto.
Scopri il costo di una generazione da riferimenti a video su questo sito prima di iniziare.
480P costa 10 crediti al secondo, 768P costa 20 e 1080P costa 35: la stessa tariffa delle modalità da testo e da immagine a video. Una generazione di 5 secondi a 480P costa 50 crediti.
Approfitta del 30% di sconto per un periodo limitato!
Fino a 12 immagini, video e audio in ingresso. Un nuovo video in uscita che riprende soggetto, stile, movimento o voce dai riferimenti.